返回簇列表
传闻簇行为开启Mongo 实时数据

评测帖称 Grok 4.6 金融研究表现接近 Claude Opus 5,成本更低

一则评测分享称,Grok 4.6 在 DiligenceBench 金融测试中以约52%—53%的成绩排名第二,与 Claude Opus 5 基本持平;其每项任务平均调用41次工具、检索3293份美国证券交易委员会文件,成本约0.84美元,低于 Opus 5 的约1.02美元,Sonnet 5 得分46.2%。帖文还称 Grok 4.6 在 FAB v2 的一般定性类别领先,显示其以更大搜索量换取更广证据覆盖,但这些比较主要反映单项评测结果。

成员
2
换头
0
最近活动
08/19 05:18:19
CONTENT GOVERNANCE

内容治理

在线

下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。

MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1 任独立事件二手报道

评测帖称 Grok 4.6 金融研究表现接近 Claude Opus 5,成本更低

一则评测分享称,Grok 4.6 在 DiligenceBench 金融测试中以约52%—53%的成绩排名第二,与 Claude Opus 5 基本持平;其每项任务平均调用41次工具、检索3293份美国证券交易委员会文件,成本约0.84美元,低于 Opus 5 的约1.02美元,Sonnet 5 得分46.2%。帖文还称 Grok 4.6 在 FAB v2 的一般定性类别领先,显示其以更大搜索量换取更广证据覆盖,但这些比较主要反映单项评测结果。

Karina来源权威 3 级(1 级最高)发布于 08/19 05:04:19原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 10 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。
#2
重复折叠二手报道

DiligenceBench评估股权研究代理的准确性与风险意识

DiligenceBench是一项面向股权研究代理的评估,覆盖能源、银行、生物科技、保险、科技、房地产投资信托、餐饮、工业和公用事业等领域的150项任务,衡量事实准确性、分析推理与风险意识。该基准已通过H1至H3的工具和工作流差异纳入部分推理时扩展,但发布者认为仍需更多评估来研究计算、搜索与工具使用对性能的影响。

Karina来源权威 3 级(1 级最高)发布于 08/19 05:04:20原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:4 个已有簇, 共 4 条代表

在 CozeLoop 查看判断
最终结果已修正为“重复折叠”,以当前持久化状态为准。