返回簇列表
多源确认簇行为开启Mongo 实时数据

DeepSeek V4 Flash 在 ARC-AGI 测试中创下性价比新基准

经 ARC Prize 官方验证,DeepSeek V4 Flash 在 ARC-AGI 测试中展现出极高的性价比,其 ARC-AGI-2 得分为 61.4%(单次任务成本 0.04 美元),ARC-AGI-1 得分为 89.0%(单次任务成本 0.02 美元)。业内专家指出,该模型在 ARC-AGI 上以仅四分之一的成本,实现了媲美 GPT-5.6 Luna (Max) 的性能表现,确立了前沿大模型成本效益的新标杆。

成员
3
换头
0
最近活动
08/08 15:16:38
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1 任独立事件二手报道

DeepSeek V4 Flash 在 ARC-AGI 测试中创下性价比新基准

经 ARC Prize 官方验证,DeepSeek V4 Flash 在 ARC-AGI 测试中展现出极高的性价比,其 ARC-AGI-2 得分为 61.4%(单次任务成本 0.04 美元),ARC-AGI-1 得分为 89.0%(单次任务成本 0.02 美元)。业内专家指出,该模型在 ARC-AGI 上以仅四分之一的成本,实现了媲美 GPT-5.6 Luna (Max) 的性能表现,确立了前沿大模型成本效益的新标杆。

fchollet来源权威 2 级(1 级最高)发布于 08/08 01:33:59原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 10 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。
#2
重复折叠二手报道

DeepSeek V4 Flash 获 ARC-AGI 高分,开发者实测双卡本地推理超 220 tokens/s

ARC Prize 官方验证 DeepSeek V4 Flash 在 ARC-AGI-2 取得 61.4% 得分,单任务成本仅 0.04 美元,确立了成本性能帕累托前沿的新标准。同时,开发者实测表明该模型在两张 RTX 6000 显卡下可实现 180K 上下文与超过 220 tokens/s 的推理速度,且具备出色的设备控制能力。这些数据验证了该模型在高效推理与本地 Agent 场景下的可用性,为开发者提供了高性价比的部署参考。

am.will来源权威 4 级(1 级最高)发布于 08/08 08:37:32原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:8 个已有簇, 共 9 条代表

归并到 DeepSeek V4 Flash 在 ARC-AGI 测试中创下性价比新基准

在 CozeLoop 查看判断
#3
重复折叠二手报道

DeepSeek V4 Flash在ARC-AGI测试中确立性价比新标准

DeepSeek V4 Flash在ARC-AGI基准测试中取得最新验证成绩,其中ARC-AGI-2准确率达61.4%(单任务成本0.04美元),ARC-AGI-1准确率达89.0%(单任务成本0.02美元)。ARC Prize官方确认,该模型确立了成本与性能帕累托前沿的新标准。这一结果凸显了DeepSeek在兼顾高推理性能与极低成本方面的显著优势,为行业提供了极具竞争力的经济型模型选择。

Zizheng Pan来源权威 3 级(1 级最高)发布于 08/08 15:08:47原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:8 个已有簇, 共 10 条代表

归并到 DeepSeek V4 Flash 在 ARC-AGI 测试中创下性价比新基准

在 CozeLoop 查看判断