Post-Training 不是「RLHF 一招走天下」,是 SFT 之后分叉出来的一整个家族:DPO、GRPO、RLAIF、拒绝采样各有各的位置。特别是 GRPO 这两年的爆火,不知道这段历史会显得跟不上节奏。 👔面试官:来讲讲 SFT 之后还有哪些 Post-Training 方法?RLHF、DPO、GRPO、拒绝采样这 ...
Fable 5 是过去半年最受市场期待的模型,而在真正发布之后,它又迅速成为“最具争议”的模型。除了安全禁令外,它的使用体验反差也相当明显:在一些任务里,Fable 5 更像一位能独立推进任务的同事,而不再是只会执行的实习生;与此同时,也有一部分开发者 ...
Fable 5 是过去半年最受市场期待的模型,而在真正发布之后,它又迅速成为“最具争议”的模型。除了安全禁令外,它的使用体验反差也相当明显:在一些任务里,Fable 5 更像一位能独立推进任务的同事,而不再是只会执行的实习生;与此同时,也有一部分开发者 ...
一些您可能无法访问的结果已被隐去。
显示无法访问的结果