CONTENT GOVERNANCE
在线内容治理
下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。
swyxmediumconfig v31
Trajectory分享持续学习后训练算法实践
摘要与判断
Trajectory团队在 aiDotEngineer World Fair 的持续学习赛道分享了后训练实践,指出将真实世界使用转化为模型改进,需要面向非可验证、按令牌计的奖励重新设计强化学习算法;团队还介绍了 GRPO 不足、转向在线策略训练并处理由此产生的问题。该分享为持续学习中的数据与训练流程设计提供了具体思路,但目前属于研究经验交流,影响主要集中在相关技术受众。
Topics
引用和原文
Trace
- Raw Item
- raw_379e63cebf1740b7
- Processed Item
- processed_26dfc9c027b54e94
- Source
- source_x_swyx
- Cluster
- 查看所属簇
- LLM Logs
- llm_4dbb9172c2f24b82, llm_47ceb137baf04874, llm_b56f58a87ffa4729
- Coze Loop
- 569a91be26888d5847bbe9dbe8b5b3d9