CONTENT GOVERNANCE

内容治理

在线

下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。

swyxmediumconfig v31

Trajectory分享持续学习后训练算法实践

摘要与判断

Trajectory团队在 aiDotEngineer World Fair 的持续学习赛道分享了后训练实践,指出将真实世界使用转化为模型改进,需要面向非可验证、按令牌计的奖励重新设计强化学习算法;团队还介绍了 GRPO 不足、转向在线策略训练并处理由此产生的问题。该分享为持续学习中的数据与训练流程设计提供了具体思路,但目前属于研究经验交流,影响主要集中在相关技术受众。

Topics

引用和原文

Trace

Raw Item
raw_379e63cebf1740b7
Processed Item
processed_26dfc9c027b54e94
Source
source_x_swyx
Cluster
查看所属簇
LLM Logs
llm_4dbb9172c2f24b82, llm_47ceb137baf04874, llm_b56f58a87ffa4729
Coze Loop
569a91be26888d5847bbe9dbe8b5b3d9