返回簇列表
当事方确认簇行为开启Mongo 实时数据

阿里云 Qwen3.8-Max 登顶全球智能体基准测试

阿里云宣布其开源权重模型 Qwen3.8-Max 在 Artificial Analysis Agentic Index 中超越25款模型,登顶全球第一。作为首个达到 Max 规模的开源模型,其在编码、工作流及长周期任务上均实现显著提升。这一基准测试的突破标志着开源模型在复杂智能体能力上实现了对闭源旗舰的实质性超越,重塑了前沿 AI 的能力边界与竞争格局。

成员
4
换头
2
最近活动
08/07 14:42:56
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
1 任簇头独立事件二手报道

Qwen3.8 Max在GDPval-AA评测中获1599分,追平Claude Sonnet 5

Artificial Analysis 公布 Qwen3.8 Max 在代理任务评测 GDPval-AA 中获得 1599 Elo,与 Claude Sonnet 5 基本持平,领先 GLM-5.2 但落后于 Kimi K3。该成绩较前代大幅提升 329 分,是其智能指数提升的核心驱动力。这一评测结果直观反映了该模型在真实世界工作任务处理能力上的显著进步,为国产大模型在复杂代理场景下的表现提供了量化参考。

Artificial Analysis来源权威 2 级(1 级最高)发布于 08/04 08:20:19原帖 内容详情
去重判断LLM 复核 · 独立事件
在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。
#2
2 任簇头事件更新当事方官宣

Qwen3.8-Max 登顶 Artificial Analysis 代理指数榜单

阿里巴巴 Qwen 团队宣布,其大语言模型 Qwen3.8-Max 在 Artificial Analysis 的最新评估中,分别位列 Intelligence Index(智能指数)第 5 名和 Agentic Index(代理指数)第 1 名。这一成绩客观反映了该模型在复杂智能与代理任务执行上的当前竞争力,为开发者在选择模型时提供了新的参考基准,团队表示将继续推进模型能力的优化。

Alibaba_Qwen来源权威 1 级(1 级最高)发布于 08/06 17:38:04原帖 内容详情
去重判断LLM 复核 · 事件更新

判断锚点 Qwen3.8 Max在GDPval-AA评测中获1599分,追平Claude Sonnet 5

在 CozeLoop 查看判断
最终结果已修正为“事件更新”,以当前持久化状态为准。
#3
重复折叠二手报道

Qwen3.8 Max 登顶 Artificial Analysis 智能体基准测试

Qwen3.8 Max 在 Artificial Analysis 智能体基准测试(agentic benchmark)中成功登顶,位列第一。这一成绩凸显了开源模型在智能体能力上的强劲表现,引发了社区对开源模型实力的进一步关注与讨论。

Markets & Mayhem来源权威 4 级(1 级最高)发布于 08/06 21:58:48原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Qwen3.8-Max 登顶 Artificial Analysis 代理指数榜单

在 CozeLoop 查看判断
#4
当前簇头 · 第 3 任重复折叠当事方官宣

阿里云 Qwen3.8-Max 登顶全球智能体基准测试

阿里云宣布其开源权重模型 Qwen3.8-Max 在 Artificial Analysis Agentic Index 中超越25款模型,登顶全球第一。作为首个达到 Max 规模的开源模型,其在编码、工作流及长周期任务上均实现显著提升。这一基准测试的突破标志着开源模型在复杂智能体能力上实现了对闭源旗舰的实质性超越,重塑了前沿 AI 的能力边界与竞争格局。

alibaba_cloud来源权威 2 级(1 级最高)发布于 08/07 14:41:59原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:5 个已有簇, 共 6 条代表

归并到 Qwen3.8-Max 登顶 Artificial Analysis 代理指数榜单

在 CozeLoop 查看判断