关注微信公众号,回复”PDF“获取独家算法资料。
谁把一个 skill 供着不放,谁就还没真正学会用它。当纪律的意思很具体,你今天用 grill-with-docs 对齐,下周发现 domain-model 更顺手,就换,不纠结,不念旧。整篇文章,就绕着「把 skill 当纪律,不当框架」这个立场转。 你让 AI 给项目加个权限控制,它唰唰改了 ...
agent 就是你写的那段程序,trainer 就是一个 actor,reward 是你在 Env 或 ChatAgent 里随手写的任意 Python。剩下的活儿三个大件全包了。README 里反复强调一个数字:大约 8600 行 RL 代码(推文里说的 9K 是个约数),却能撑到 1T 级别的 MoE。 OpenRLHF 的 ...
一些您可能无法访问的结果已被隐去。
显示无法访问的结果