#1
当前簇头 · 第 1 任独立事件当事方官宣
Liquid AI 披露模型后训练的四个阶段及智能体强化学习细节
Liquid AI 披露了其模型的后训练细节,强调在真实智能体工具链中进行训练。后训练分为 SFT、专家特化、多领域同策略蒸馏和智能体强化学习四个阶段,其中最后阶段通过 Pi、Hermes Agent 和 OpenClaw 进行多轮强化学习。每次运行均在独立沙盒中通过 GRPO 算法优化,结合大模型裁判、程序化检查和安全门进行评估。这为业界提供了关于高级智能体模型训练流程的具体技术参考。
去重判断LLM 复核 · 独立事件
在 CozeLoop 查看判断 最终结果已修正为“独立事件”,以当前持久化状态为准。