系列 · 5 篇文章
后训练实战
ORBIT 中的数据生成、验证器、GRPO、DPO 与自我博弈。
沿着 ORBIT 的训练轨迹,了解生成与筛选、奖励验证、GRPO、DPO 和自我博弈。文章区分可执行路径与设计草图,并说明评测如何限制结论。
下文按系列顺序排列:先了解问题边界,再阅读实现与排查细节。
本系列文章
-
LLM 后训练数据:生成、验证与通过率
13 分钟 -
约束规划的 SFT 冷启动与 GRPO
13 分钟
系列 · 5 篇文章
ORBIT 中的数据生成、验证器、GRPO、DPO 与自我博弈。
沿着 ORBIT 的训练轨迹,了解生成与筛选、奖励验证、GRPO、DPO 和自我博弈。文章区分可执行路径与设计草图,并说明评测如何限制结论。
下文按系列顺序排列:先了解问题边界,再阅读实现与排查细节。