2|双层架构层数
字节跳动开源Bernini统一框架:AI视频编辑从盲生成迈入可控时代
双层架构:理解与生成分离
Bernini创新性采用双层架构:MLLM多模态大模型作为规划器负责语义理解,解析文本指令、源视频和参考素材,生成清晰的语义规划方案;DiT扩散模型作为渲染器承接语义目标,专注高质量视觉渲染,保留原视频结构、镜头与运动关系。这种先规划后落地的模式彻底解决了AI视频编辑效果失控的痛点。
全场景可控编辑能力
Bernini覆盖视频编辑、参考生成全场景:支持指令化精准编辑,一键修改天气、材质、风格并同步调整环境光影;支持图片/视频作为参考素材,可植入指定物体、迁移材质风格;支持关键帧生成连续镜头,理解空间逻辑,适配虚拟漫游和影视预演等场景。
开源生态影响
目前Bernini推理代码与权重已开放,完整版本即将上线。这是继HunyuanVideo、Wan2.2之后又一个重量级国产AI视频开源项目,有望推动AI视频创作从专业工具向大众化普及,降低高质量视频创作的技术门槛。
← 返回资讯列表
AI8899 · 内容仅供学习参考