量子位mediumconfig v30
Noiz AI联合多机构发布实时音视频世界模型HelixWorld 1.0
摘要与判断
Noiz AI联合清华大学、CMU及Google DeepMind等机构,正式发布实时可交互音视频世界模型HelixWorld 1.0。该模型支持24FPS画面与48kHz双声道音频的实时生成,通过原生Transformer架构实现画面与声音对用户操作的统一响应。模型权重及代码计划于数周内完全开源,这一进展为多模态实时交互与虚拟内容创作提供了新的技术参考。
Topics
引用和原文
Trace
- Raw Item
- raw_bf488663c4d947b5
- Processed Item
- processed_f96327d65697455e
- Source
- source_wechat_liangziwei
- Cluster
- 查看所属簇
- LLM Logs
- llm_327583b30fe5452a, llm_c24ec28e6d1f4cb1, llm_98f804c854eb40c9
- Coze Loop
- e6fd783e84b8ae2d2bf51f298d40ba89