#1
当前簇头 · 第 1 任独立事件二手报道
长程终端基准测试发布:MiniMax M3 登顶,Kimi K2.7 Code 与 GLM 5.2 分列二三
长程终端基准测试(LHTB)在 Hugging Face Hub 发布,包含46项任务,要求大语言模型智能体在终端连续完成300多步操作;榜单前三为 MiniMax M3、Kimi K2.7 Code 和 GLM 5.2,评测采用抗污染设计及隐藏验证器检查真实状态。该基准把智能体长程执行稳定性纳入可比较指标,也为本地小模型的终端能力评估提供了测试场景。
去重判断LLM 复核 · 独立事件
在 CozeLoop 查看判断 簇级候选:8 个已有簇, 共 9 条代表。
最终结果已修正为“独立事件”,以当前持久化状态为准。