← 文章

系列 · 5 篇文章

后训练实战

ORBIT 中的数据生成、验证器、GRPO、DPO 与自我博弈。

沿着 ORBIT 的训练轨迹,了解生成与筛选、奖励验证、GRPO、DPO 和自我博弈。文章区分可执行路径与设计草图,并说明评测如何限制结论。

下文按系列顺序排列:先了解问题边界,再阅读实现与排查细节。

本系列文章

  1. LLM 后训练数据:生成、验证与通过率

    13 分钟
  2. 约束规划的 SFT 冷启动与 GRPO

    13 分钟
  3. 规划 Agent 奖励设计:验证器、奖励模型与奖励漏洞

    13 分钟
  4. 角色扮演 DPO:偏好对与 chosen 概率监控

    12 分钟
  5. OpenSpiel 训练数据:MCTS、CFR 与轨迹筛选

    13 分钟