Pika Audio推出4个生成式音频模型
一名用户展示了Pika Audio的早期访问测试:将一段静音视频交给模型后,系统在单次生成中完成音频制作,并让声音与画面动作同步。Pika表示Audio已推出4个生成式音频模型,内容主要体现其视频配音与音画同步能力。
簇级候选:1 个已有簇, 共 1 条代表。
Pika介绍其四款前沿音频模型之一的配乐模型,可在无需额外指令的情况下,为视频生成与画面动作匹配的音乐、旁白和音效,并展示了8个创作者案例。该产品将多类音频生成能力合并到视频处理流程中,主要面向需要快速完成配乐、配音与动作音效制作的创作者和视频团队。
下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。
一名用户展示了Pika Audio的早期访问测试:将一段静音视频交给模型后,系统在单次生成中完成音频制作,并让声音与画面动作同步。Pika表示Audio已推出4个生成式音频模型,内容主要体现其视频配音与音画同步能力。
簇级候选:1 个已有簇, 共 1 条代表。
Pika介绍其四款前沿音频模型之一的配乐模型,可在无需额外指令的情况下,为视频生成与画面动作匹配的音乐、旁白和音效,并展示了8个创作者案例。该产品将多类音频生成能力合并到视频处理流程中,主要面向需要快速完成配乐、配音与动作音效制作的创作者和视频团队。
Pika介绍了 Soundtrack 的音频生成机制:先将视频压缩为保留时序、运动和场景布局的潜在标记,再把文本提示转为语义标记,由潜在扩散 Transformer 通过交叉注意力同步处理视频与文本并生成音频。该设计强调声音内容与画面节奏、动作及场景的对应关系,为视频配乐和音效生成提供了技术路径。
Pika披露其Soundtrack模型的技术测试结果:在包含67个片段的基准测试中,该模型在语义对齐和视听同步两项指标上均排名第一,ImageBind得分为0.2457,DeSync得分为0.5537。结果显示,Pika正将视频与音频的匹配质量作为模型能力重点,但目前属于产品性能披露,主要影响相关音视频生成领域的技术比较。
Pika Soundtrack发布技术介绍,称其重点优化视频与音频的对齐效果,并在包含67个片段的基准测试中,在语义对齐和视听同步两项指标上排名第一,测试分数分别为ImageBind 0.2457、DeSync 0.5537。该信息属于模型能力展示,主要帮助关注者了解其在音视频匹配质量上的表现。