8月5日,字节跳动Seed宣布正式推出原生音视频全双工大模型SeedRealtime。
据介绍,作为走向全模态交互的关键一步,SeedRealtime用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。
它实现了以下三项核心突破:
音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。
主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。
流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。
全模态自然交互技术最适用的场景就是AI游戏,比如游戏NPC,AI陪伴等场景

目前,SeedRealtime 已在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地。
----------------------------------------------
关注汤姆猫
作为国内外知名的AI陪伴IP,全世界粉丝无数
会说话的汤姆猫家族”IP 全球累计下载超240 亿次,YouTube 官方频道总订阅超9300 万
公司在很早之前就将旗下AI陪伴机器人接入了豆包,随着豆包全面升级
SeedRealtime,汤姆猫的陪伴体验将更接近人类的互动实时陪伴。


汤姆猫,让全世界体验中国的AI技术。
另外,
盛天网络:旗下“给麦”已接入字节,SeedRealtime“边听边说”深度赋能
富春股份:与字节游戏深度合作,受益全模态交互
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。