Halo Neuro正式发布Sopro V2语音克隆文本转语音模型家族,并开源其中的轻量级多语言模型Sopro V2 Turbo。该模型仅120M参数,具备语音克隆能力,支持多语言合成,并原生支持欧洲葡萄牙语,能够在笔记本CPU和浏览器环...
Read More字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技...
Read More根据PitchBook的最新数据,全球AI语音初创公司在2026年第一季度共获得70亿美元融资,而该数字在2025年同期仅为10亿美元,同比增幅高达600%。这一爆发式增长反映出资本对语音赛道的强烈信心,背后推手是人工智能行业...
Read More谷歌近日发布了Gemini 3.5 Live Translate,这是一个全新的音频模型,专注于实现实时语音到语音的翻译。与传统的语音翻译相比,该模型支持超过70种语言,并致力于消除翻译过程中常见的尴尬停顿,同时保持语调和情感...
Read MoreThinking Machines Lab 近日发布了一项名为“交互模型”的研究预览,旨在通过音频、视频和文本三种模态,实现人类与人工智能之间的实时协作。该模型采用从头训练的“多流架构”,能够持续处理与交换多模态信息,彻底打破...
Read MoreOpenAI近日发布了一份工程指南,详细介绍了如何使用其最新优化的模型gpt-realtime-translate构建实时语音翻译系统。该模型专为同声传译场景设计,与传统的轮次语音交互不同,它能实现对语音流进行实时、连续的翻译处...
Read More谷歌近期在Gemma大型语言模型上实现了令人瞩目的推理速度提升,成功将性能提升了三倍。这一突破性进展的核心在于采用了“投机解码”(Speculative Decoding)技术。该技术的工作原理是部署一个轻量级、速度极快的“草稿...
Read MoreOpenAI近日在API中正式推出了一系列全新的实时音频模型,标志着语音交互技术迈入了一个全新阶段。该系列包括三款核心模型:GPT-Realtime-2,专注于增强对话式推理能力,能够实现更自然、更具逻辑性的实时语音对话;G...
Read More