Derya Unutmaz, MDmediumconfig v30
阿里开源 Qwen 3.8-27B 模型,单张 RTX 5090 解码超 200 tok/s
摘要与判断
阿里巴巴 Qwen 团队正式开源 Qwen 3.8-27B 模型,SGLang 框架已提供首日支持,其在单张 RTX 5090 显卡上的解码速度突破 200 tokens/s。该模型展现出比肩半年前顶尖模型 Opus 4.6 的性能水平,为开发者在端侧或单卡环境部署高性能小模型提供了更优的开源选择。
Topics
引用和原文
Trace
- Raw Item
- raw_f58884c14f2e449c
- Processed Item
- processed_184c189bfbaf48cb
- Source
- source_x_deryatr
- Cluster
- 查看所属簇
- LLM Logs
- llm_1bd82cc866b047ed, llm_3a9097f46ac44b1d, llm_4540081b7ab34017
- Coze Loop
- e3f7cba837f67520a5c98d589cc39325