返回首页

24小时热榜

136作者: thisisauserid大约 1 小时前原帖
<a href="https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash" rel="nofollow">https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash</a>
8作者: alex000kim大约 5 小时前原帖
我能写出的最小异步强化学习训练器:一个循环在笔记本电脑上运行REINFORCE算法进行CartPole训练,同时在集群上异步运行GRPO(例如,8个H100训练器,8个vLLM工作节点,作为一个[SkyPilot作业组](<a href="https:&#x2F;&#x2F;docs.skypilot.ai&#x2F;en&#x2F;latest&#x2F;examples&#x2F;job-groups.html" rel="nofollow">https:&#x2F;&#x2F;docs.skypilot.ai&#x2F;en&#x2F;latest&#x2F;examples&#x2F;job-groups.html</a>)在Kubernetes上运行)。<p>这一切都不依赖于Ray、TRL或DeepSpeed等,工作节点通过标准库HTTP与训练器进行通信。