返回簇列表
当事方确认簇行为开启Mongo 实时数据

Prime Intellect 发布针对 Blackwell 优化的 MoE 推理内核 Prime Flash MoE

Prime Intellect 正式发布针对 Blackwell 架构优化的 MoE 推理 CUDA 内核集合 Prime Flash MoE。该方案创新性地融合了路由感知 GEMM、SwiGLU 激活、量化与归约操作,有效避免了中间张量的物化,同时支持 BF16 与 MXFP8 计算路径,并已在 B200 GPU 上完成基准测试。这一底层优化为基于最新英伟达硬件的大规模混合专家模型推理提供了更高效的算力支持与内存管理方案。

成员
3
换头
1
最近活动
08/14 05:24:40
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
1 任簇头重复折叠二手报道

Prime Intellect 发布 Blackwell 架构优化的 MoE 推理内核 Prime Flash MoE

Prime Intellect 发布了针对 Blackwell 架构优化的 CUDA 内核集合 Prime Flash MoE,专为混合专家模型(MoE)推理设计。该工具融合了路由感知 GEMM、SwiGLU、量化和归约操作,避免物化中间结果,支持 BF16 与 MXFP8 路径,并在 B200 GPU 上完成基准测试。这为开发者在最新硬件上部署 MoE 模型提供了更高效的底层支持。

Johannes Hagemann来源权威 4 级(1 级最高)发布于 08/14 02:29:08原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 8 条代表

在 CozeLoop 查看判断
最终结果已修正为“重复折叠”,以当前持久化状态为准。
#2
当前簇头 · 第 2 任事件更新当事方官宣

Prime Intellect 发布针对 Blackwell 优化的 MoE 推理内核 Prime Flash MoE

Prime Intellect 正式发布针对 Blackwell 架构优化的 MoE 推理 CUDA 内核集合 Prime Flash MoE。该方案创新性地融合了路由感知 GEMM、SwiGLU 激活、量化与归约操作,有效避免了中间张量的物化,同时支持 BF16 与 MXFP8 计算路径,并已在 B200 GPU 上完成基准测试。这一底层优化为基于最新英伟达硬件的大规模混合专家模型推理提供了更高效的算力支持与内存管理方案。

Prime Intellect来源权威 3 级(1 级最高)发布于 08/14 02:28:43原帖 内容详情
去重判断LLM 复核 · 事件更新

簇级候选:8 个已有簇, 共 9 条代表

判断锚点 Prime Intellect 发布 Blackwell 架构优化的 MoE 推理内核 Prime Flash MoE

在 CozeLoop 查看判断
最终结果已修正为“事件更新”,以当前持久化状态为准。
#3
重复折叠二手报道

Prime Intellect 发布针对 Blackwell 优化的 MoE 推理内核 Prime Flash MoE

Prime Intellect 发布了专为 Blackwell 架构优化的 CUDA 内核集合 Prime Flash MoE,旨在提升混合专家(MoE)模型的推理效率。该内核融合了路由感知 GEMM、SwiGLU、量化及归约操作,避免了中间张量的物化,并支持 BF16 与 MXFP8 路径,已在 B200 GPU 上完成基准测试。这一发布为开发者在最新硬件上部署复杂模型提供了更底层的性能优化方案。

elie来源权威 4 级(1 级最高)发布于 08/14 05:23:18原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:8 个已有簇, 共 10 条代表

归并到 Prime Intellect 发布针对 Blackwell 优化的 MoE 推理内核 Prime Flash MoE

在 CozeLoop 查看判断