资讯
字节跳动豆包大模型上线AI视频通话功能,实时交互门槛被打破
豆包AI视频通话正式上线
6月22日,字节跳动旗下豆包大模型正式上线AI视频通话功能。用户更新抖音或豆包App后,可一键发起与AI的视频通话。AI能实时理解摄像头捕获的画面——识别场景、人物、物体和文字,并根据视觉信息与用户进行自然的语音对话。这标志着消费级AI交互从纯文字进入了实时视频交互的新阶段。
技术突破:端到端实时多模态
与传统AI视频分析需要数秒延迟不同,豆包AI视频通话实现了200毫秒以内的实时响应。技术核心在于字节自研的端到端多模态模型,将视觉编码、语义理解和语音合成整合为统一的推理流水线。在演示中,AI可以准确识别用户举起的一本书的封面并介绍内容,也能在看用户做饭时给出烹饪建议。
应用场景广阔
该功能首批开放的教育场景包括:作业辅导——AI通过视频看题实时讲解;生活助手——识别植物、翻译菜单、导览景点;购物助手——实时识别商品并比价。字节跳动表示,豆包AI视频通话功能将在未来两个月内扩展至电商带货和远程协作场景。业内认为,实时多模态交互将成为2026年下半年AI应用竞逐的核心赛道。
← 返回资讯列表
AI8899 · 内容仅供学习参考