量子位mediumconfig v30

Noiz AI联合多机构发布实时音视频世界模型HelixWorld 1.0

摘要与判断

Noiz AI联合清华大学、CMU及Google DeepMind等机构,正式发布实时可交互音视频世界模型HelixWorld 1.0。该模型支持24FPS画面与48kHz双声道音频的实时生成,通过原生Transformer架构实现画面与声音对用户操作的统一响应。模型权重及代码计划于数周内完全开源,这一进展为多模态实时交互与虚拟内容创作提供了新的技术参考。

Topics

引用和原文

Trace

Raw Item
raw_bf488663c4d947b5
Processed Item
processed_f96327d65697455e
Source
source_wechat_liangziwei
Cluster
查看所属簇
LLM Logs
llm_327583b30fe5452a, llm_c24ec28e6d1f4cb1, llm_98f804c854eb40c9
Coze Loop
e6fd783e84b8ae2d2bf51f298d40ba89