返回簇列表
当事方确认簇行为开启Mongo 实时数据

Kimi K3 在 VoxelBench 基准测试中排名第三,性能较前代显著提升

Kimi K3 在 VoxelBench 基准测试中取得第三名,Elo 分数仅落后 Fable 100 余分。相比此前排名第 28 位的 K2.6 版本,K3 实现了显著的性能跃升。这一成绩由 Kimi 官方转发确认,反映出该系列模型在能力上的快速迭代,为开发者评估其性能提供了新的参考基准。

成员
29
换头
3
最近活动
07/22 03:45:50
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
1 任簇头独立事件传闻推测

业内人士预测 Kimi-K3 将淘汰 Opus 级别模型

业内人士针对 AI 模型的发展趋势发表观点,认为 Sonnet 级别的模型此前已经失去竞争力,而随着 Kimi-K3 的出现,Opus 级别的模型预计也将被淘汰。该观点指出,前沿 AI 实验室现在必须将研发方向转向十万亿(10T)参数规模的模型,以维持技术领先地位。

Andrew Curran来源权威 3 级(1 级最高)发布于 07/14 22:19:22原帖 内容详情
去重判断LLM 复核 · 独立事件
在 CozeLoop 查看判断
#2
2 任簇头事件更新二手报道

TechCrunch:Moonshot 即将推出的 Kimi 3 预计将缩小与 Opus 4.8 的差距

TechCrunch 报道称,Moonshot 即将推出的 Kimi 3 模型预计将缩小与 Anthropic 旗下 Opus 4.8 的性能差距。这表明国产大模型正持续追赶国际头部闭源旗舰的迭代步伐,但目前该消息仍属于媒体预期阶段,具体发布时间与实际能力表现仍有待官方确认与后续实测。

TechCrunch来源权威 2 级(1 级最高)发布于 07/16 22:29:16原帖 内容详情
去重判断LLM 复核 · 事件更新
在 CozeLoop 查看判断
#3
事件更新二手报道

Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

Kimi K3在最新AI模型基准测试中表现优异,综合排名仅次于Claude Fable 5 Max与GPT-5.6 Sol Max,并成功超越了Claude Opus 4.8 Max的1600分。这一成绩显示该模型在核心能力上已具备抗衡甚至超越部分国际头部闭源旗舰的实力,同时引发了开发者社区对其未来开源版本的强烈期待。

Yuchen Jin来源权威 3 级(1 级最高)发布于 07/16 23:27:46原帖 内容详情
去重判断LLM 复核 · 事件更新
在 CozeLoop 查看判断
#4
重复折叠二手报道

Kimi K3 基准测试成绩曝光:部分指标击败 GPT 5.6

Kimi K3 模型(2.8万亿参数,100万上下文)最新基准测试成绩公布。在 BrowseComp 测试中位列第一,击败 GPT 5.6 Sol Max 与 Fable 5 Max;在 AA-Briefcase 中排名第二,超越 GPT 5.6 Sol Max;在 GDPval-AA v2 中排名第三。这一成绩表明开源模型在特定任务上已具备挑战甚至超越头部闭源旗舰的能力,对前沿 AI 竞争格局具有重要参考价值。

Ahmad来源权威 4 级(1 级最高)发布于 07/16 23:38:19原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#5
重复折叠二手报道

Kimi K3基准测试成绩曝光,部分任务击败GPT 5.6

Kimi K3模型参数规模达2.8万亿,支持100万上下文长度。最新基准测试显示,其在BrowseComp任务中排名第一,击败了GPT 5.6 Sol Max与Fable 5 Max;在AA-Briefcase和GDPval-AA v2中也分别取得第二和第三的成绩。这一跑分结果展示了该模型逼近头部闭源旗舰的能力,引发了业内关于开源AI未来竞争优势的讨论。

Ahmad来源权威 4 级(1 级最高)发布于 07/17 00:16:42原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#6
重复折叠二手报道

Kimi K3 基准测试发布,性能据称达到 Fable/Sol 级别

Kimi K3 模型的基准测试结果已发布,据第三方消息称其性能达到了 Fable/Sol 级别。这一进展显示了中国大模型在追赶国际头部旗舰模型方面的最新成果,为行业提供了新的高性能模型选择。

Guto.ETH来源权威 4 级(1 级最高)发布于 07/17 01:49:47原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#7
重复折叠二手报道

Kimi K3 基准测试结果发布,性能据称达 Fable/Sol 级别

Kimi K3 模型的基准测试结果已发布,据第三方消息称,其整体性能表现大约达到了 Fable/Sol 的同等水平。这一测试结果为评估该模型在当前大语言模型竞争格局中的实际能力提供了初步参考。

Brendan O'Donoghue来源权威 4 级(1 级最高)发布于 07/17 01:48:04原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#8
重复折叠二手报道

Kimi K3 基准测试表现曝光:最大思考强度下接近 Fable-5

Kimi K3 在最大思考强度下的基准测试表现曝光。测试结果显示,其性能已接近包含回退机制的 Fable-5,并显著超越了 Opus 4.8、GPT-5.6 Sol 以及 GPT 5.5 等主流模型。这一数据展示了 Kimi K3 在复杂推理任务上的竞争力,为当前大模型性能梯队提供了新的参考。

Andrew Curran来源权威 3 级(1 级最高)发布于 07/17 01:57:03原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#9
重复折叠二手报道

业内人士评价 Kimi 能力已追平当前前沿大模型

业内人士指出,中国 AI 实验室技术大幅落后的时代已经结束,Kimi 的能力至少已与当前公开的前沿模型持平。这一评价反映出头部大模型竞争格局的显著变化,提示业界在失去原有技术代差与竞争优势后,必须转变战略思维,重新审视未来的发展路径。

Andrew Curran来源权威 3 级(1 级最高)发布于 07/17 02:51:51原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#10
重复折叠二手报道

业内人士评价Kimi已追平国际前沿大模型

业内人士roon发文表示,中国实验室在AI领域远远落后的时代已经结束,Kimi的能力至少已经与现代公共前沿模型处于同一水平。他强调,在失去原有竞争优势的背景下,人们现在必须改变原有的思维方式。这一观点反映了业内对中国大模型能力快速提升的认可,提示全球AI竞争格局正面临新的变化。

Ankit Gupta来源权威 4 级(1 级最高)发布于 07/17 03:11:12原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#11
重复折叠二手报道

Kimi K3 在 Intelligence Index 跑分逼近顶级闭源模型

Kimi K3 在 Intelligence Index 上的得分仅略低于 Fable 5 和 GPT 5.6 Sol Max。由于 Fable 5 在 Kimi K3 训练的大部分时间里尚未公开,排除了其通过蒸馏获取能力的可能。这一基准测试结果表明,开源模型在核心能力上已逼近顶级闭源旗舰模型,进一步缩小了开源与闭源阵营的差距。

Ahmad来源权威 4 级(1 级最高)发布于 07/17 06:20:56原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#12
重复折叠二手报道

中国开源模型 Kimi 取得前沿级成果引发轰动

中国开源权重模型 Kimi 取得前沿级别的测试结果,在人工智能领域引发广泛轰动。这一重大突破标志着中国开源模型在能力边界上已成功跻身全球顶尖行列,展现出极强的竞争力。该成果不仅证明了开源路线在追赶甚至比肩头部闭源旗舰模型方面的潜力,也可能对全球人工智能基础模型的竞争格局与未来发展方向产生深远影响。

axios来源权威 2 级(1 级最高)发布于 07/17 06:55:05原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#13
重复折叠二手报道

Kimi新模型K3在Artificial Analysis总榜排名全球第3

Kimi新模型K3在第三方评测机构Artificial Analysis的智能总榜中排名达到全球第3,打破了此前GLM-5.2创下的全球第4纪录。这一成绩刷新了国产大模型在该榜单上的历史最高排名,显示出国产大模型在国际顶尖基准测试中的竞争力进一步提升,对国内AI行业的发展具有重要指标意义。

阑夕来源权威 3 级(1 级最高)发布于 07/17 12:16:52原帖 内容详情
去重判断LLM 复核 · 重复折叠
在 CozeLoop 查看判断
#14
重复折叠二手报道

K3模型基准得分获官方确认:全面超越Opus 4.8且定价极低

K3 模型的基准测试得分已获得官方确认。数据显示,这款 Fable/Sol 级别的模型在各项指标上全面超越了 Opus 4.8,而其定价仅与 Sonnet 相当。这一极具破坏性的性价比优势将对当前头部 AI 模型的市场竞争格局产生重大冲击,显著提升了前沿模型的可用性与成本标准。

clem 🤗来源权威 1 级(1 级最高)发布于 07/17 09:54:43原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#15
重复折叠二手报道

Kimi K3 实测结果公布:复杂开发能力比肩 Opus 4.8

Kimi K3 模型的最新实测结果显示,其在复杂前端和开发任务中的表现与 Opus 4.8 互有胜负,水平基本相当。尽管在 Fable 5 和 5.6 基准上仍有差距,但这一表现被评价为“较小的 DeepSeek 时刻”,为开发者评估国产大模型在复杂编程场景下的可用性提供了重要参考。

歸藏来源权威 3 级(1 级最高)发布于 07/17 12:12:10原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#16
重复折叠二手报道

业内评价称 Kimi K3 性能比肩 Sol 与 Fable,大幅超越 Opus 4.8

AI 社区有观点指出,Kimi K3 模型在多项性能表现上已追平或超越 Sol 与 Fable,并大幅领先于 Opus 4.8。这一基于基准测试列表的评价引发了业内人士对新一轮模型性能炒作的调侃,反映出当前头部大模型竞争与社区舆论的活跃状态。

Susan Zhang来源权威 4 级(1 级最高)发布于 07/17 15:25:12原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#17
重复折叠传闻推测

Kimi-K3基准测试泄露:多项指标击败GPT-5.6 Sol及Opus 4.8

据最新泄露的基准测试数据显示,Kimi-K3 在目前已知的14项测试中表现抢眼:其中11项击败 GPT-5.6 Sol,14项全部超越 Opus 4.8,并在6项测试中优于 Fable 5。此外,在与定价最直接的竞争对手 Sonnet 5 的对比中,Kimi-K3 取得了压倒性的全面胜利。这一泄露数据表明 Kimi-K3 展现出了比肩甚至超越当前头部旗舰模型的强劲实力,若最终获官方证实,将对同价位大模型 API 市场格局产生显著冲击。

Siqi Chen来源权威 3 级(1 级最高)发布于 07/17 11:52:22原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#18
重复折叠二手报道

LiveBench 测试显示 Kimi K3 为最佳开源模型但落后于前沿闭源模型

Bindu Reddy 公布了 Kimi K3 在 LiveBench 基准测试中的表现,指出其是目前最好的开源模型,但整体排名仍落后于 Opus 4.8、Sol 和 Fable 等前沿闭源模型。此外,实测显示 Kimi K3 在处理复杂任务时存在成本高、速度慢及“空转”等问题。这为开发者评估和选择开源大模型提供了具体的性能与成本参考。

Bindu Reddy来源权威 3 级(1 级最高)发布于 07/17 12:54:59原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#19
重复折叠二手报道

Kimi K3基准测试得分比肩GPT-5.5,Moonshot AI计划开源其2.8T参数权重

Artificial Analysis基准测试显示,Moonshot AI的Kimi K3模型得分为57分,智能水平与Opus 4.8和GPT-5.5相当,但仍落后于Fable 5和GPT-5.6 Sol。Moonshot AI已表示计划开源这款2.8T参数模型的权重,若顺利落地,Kimi K3有望成为当前领先的开源大模型,进一步加剧开源与闭源模型阵营的竞争。

AI Breakfast来源权威 4 级(1 级最高)发布于 07/17 11:44:11原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#20
3 任簇头事件更新二手报道

Kimi K3 登顶 Vals Index 榜单第二,超越 GPT 5.6 Sol

Vals AI 发布的最新 Vals Index 榜单显示,Moonshot 旗下的 Kimi K3 模型整体排名跃升至第二位。该模型成功超越了 GPT 5.6 Sol,目前仅以微弱差距落后于 Fable 5。这一基准测试结果标志着中国大模型在综合推理与生成能力上实现了对国际头部旗舰模型的实质性超越,重塑了全球顶尖 AI 模型的能力格局。

Kimi.ai来源权威 1 级(1 级最高)发布于 07/17 15:02:30原帖 内容详情
去重判断LLM 复核 · 事件更新

判断锚点 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
最终结果已修正为“事件更新”,以当前持久化状态为准。
#21
重复折叠二手报道

Kimi K3 登顶 DeepSWE 第三,成首个比肩 GPT-5.6 的开源模型

Kimi K3 在 DeepSWE 基准测试中首次亮相即位列第三,成为首个展现出前沿级性能的开源权重模型。其测试结果已逼近 Claude Fable 和 GPT-5.6 Sol 等头部闭源旗舰,标志着开源大模型在核心能力上实现了追平顶尖闭源模型的重大突破,将深刻改变行业竞争格局。

Siqi Chen来源权威 3 级(1 级最高)发布于 07/18 03:37:34原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#22
重复折叠二手报道

Kimi K3 登榜 DeepSWE 第三,成首个比肩闭源旗舰的开放权重模型

Kimi K3 在 DeepSWE 基准测试中首次亮相即位列第三,成为首个展现出前沿级性能的开放权重模型。其测试结果与闭源旗舰模型 Claude Fable 及 GPT-5.6 Sol 表现相近。这一突破标志着开源模型在复杂软件工程任务上正式追平头部闭源旗舰,大幅拓宽了开源 AI 的能力边界与应用潜力。

Y Combinator来源权威 2 级(1 级最高)发布于 07/18 03:49:57原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#23
重复折叠二手报道

Kimi K3 登顶 DeepSWE 榜单第三,被评为首个达前沿性能的开放权重模型

Kimi K3 在 DeepSWE 榜单中首次亮相即位列第三,被 Datacurve 称为首个达到前沿性能(媲美 Claude Fable 与 GPT-5.6 Sol)的开放权重模型。研究者 Andrew Carr 实测其完美通过诗歌基准测试,认为其实际能力落后未发布的前沿模型约 6-9 个月,该模型的潜在开源将为本地算力部署与前沿应用带来重要影响。

Andrew Carr 🤸来源权威 4 级(1 级最高)发布于 07/18 03:52:55原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#24
重复折叠二手报道

Kimi K3 登榜 DeepSWE 第三,成首个比肩闭源旗舰的开源模型

Kimi K3 在 DeepSWE 基准测试中首次亮相即位列第三,成为首个展现出前沿级性能的开放权重模型。其测试结果与头部闭源旗舰模型 Claude Fable 及 GPT-5.6 Sol 相当。这一突破标志着开源模型在复杂软件工程任务上正式追平顶尖闭源模型,大幅拓展了开源 AI 的能力边界与应用潜力。

Ankit Gupta来源权威 4 级(1 级最高)发布于 07/18 03:49:49原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#25
当前簇头 · 第 4 任事件更新当事方官宣

Kimi K3 在 VoxelBench 基准测试中排名第三,性能较前代显著提升

Kimi K3 在 VoxelBench 基准测试中取得第三名,Elo 分数仅落后 Fable 100 余分。相比此前排名第 28 位的 K2.6 版本,K3 实现了显著的性能跃升。这一成绩由 Kimi 官方转发确认,反映出该系列模型在能力上的快速迭代,为开发者评估其性能提供了新的参考基准。

Kimi.ai来源权威 1 级(1 级最高)发布于 07/18 22:20:39原帖 内容详情
去重判断LLM 复核 · 事件更新

判断锚点 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
最终结果已修正为“事件更新”,以当前持久化状态为准。
#26
重复折叠二手报道

Kimi K3 登榜 DeepSWE 第三,成首个达前沿性能的开源模型

Kimi K3 在 DeepSWE 基准测试中首次亮相即位列第三,成为首个展现出前沿级性能的开源权重模型。其测试结果已逼近 Claude Fable 和 GPT-5.6 Sol 等头部闭源旗舰模型。这一突破标志着开源模型在复杂软件工程任务上的能力边界被大幅拓宽,可能重塑当前由闭源模型主导的顶级 AI 性能格局。

garrytan来源权威 2 级(1 级最高)发布于 07/18 23:35:06原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 目标帖子

在 CozeLoop 查看判断
最终结果已修正为“重复折叠”,以当前持久化状态为准。
#27
重复折叠二手报道

Kimi K3 登榜 DeepSWE 第三,成首个前沿级开放权重模型

Kimi K3 在 DeepSWE 基准测试中首秀位列第三,成为首个展现前沿级性能的开放权重模型。其测试结果与 Claude Fable 和 GPT-5.6 Sol 相当,并超越了 Opus 4.8 和 GPT-5.5。这一突破标志着开源模型在复杂任务上正式追平头部闭源旗舰,大幅改变了当前 AI 基础模型的能力边界与竞争格局。

Derya Unutmaz, MD来源权威 3 级(1 级最高)发布于 07/19 10:26:26原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3基准测试成绩曝光:超越Claude Opus 4.8 Max位列第三

在 CozeLoop 查看判断
#28
重复折叠二手报道

雷科技发文称Kimi K3登顶全球AI榜首

雷科技发文宣称国产大模型 Kimi K3 登顶全球 AI 榜首,并表示其实力碾压欧美模型,甚至让马斯克低调认怂。该内容主要为情绪化的营销表达,缺乏具体的测试榜单与数据细节支撑,属于典型的标题党资讯。

雷科技来源权威 3 级(1 级最高)发布于 07/21 17:11:56原帖 内容详情
去重判断LLM 复核 · 重复折叠

归并到 Kimi K3 登顶 Vals Index 榜单第二,超越 GPT 5.6 Sol

在 CozeLoop 查看判断
#29
重复折叠二手报道

Semafor:Kimi K3 缩小中美 AI 差距,凸显美芯片管制局限

Semafor 撰文指出,Moonshot 新推出的开源模型 Kimi K3 展现了中国在 AI 领域的雄心,进一步缩小了与美国的领先差距。该报道认为,Kimi K3 的表现不仅凸显了美国芯片出口管制的局限性,也引发了对美国科技巨头当前激进 AI 投资策略的质疑。

semafor来源权威 3 级(1 级最高)发布于 07/22 03:37:00原帖 内容详情
在 CozeLoop 查看判断