漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-28 talkingdev

设备端实时语音克隆新突破:Halo Neuro开源Sopro V2 Turbo

Halo Neuro正式发布Sopro V2语音克隆文本转语音模型家族,并开源其中的轻量级多语言模型Sopro V2 Turbo。该模型仅120M参数,具备语音克隆能力,支持多语言合成,并原生支持欧洲葡萄牙语,能够在笔记本CPU和浏览器环...

Read More
2026-08-28 talkingdev

SGLang Diffusion加持:MiniMax-H3视频生成在8×H200上无损提速1.95倍,最高6.24倍

LMSYS.org发布的最新基准测试显示,在8×NVIDIA H200 GPU环境中,SGLang Diffusion对MiniMax-H3视频生成工作负载实现了显著加速。测试严格固定提示词、随机种子、分辨率、帧率和去噪步数,并在六类工作负载上进行比较...

Read More
2026-08-25 talkingdev

NVIDIA Groq 3 LPX AI推理加速芯片全面量产,Vera Rubin迎来史上最快Token生成速度

NVIDIA的Groq 3 LPX AI推理加速芯片现已进入全面量产阶段。Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,显著提升了AI推理能力,能够为响应敏感型智能体(Agentic)工作负载提供超高速的Token生成表现。在面向智...

Read More
2026-08-14 talkingdev

OpenAI发布GPT-5.6 Sol超高速模式:推理速度最高提升14倍,每秒输出750 tokens

OpenAI正式预览了GPT-5.6 Sol的Ultrafast模式,该模式在推理速度上实现显著突破,最高可生成750个输出token/秒,整体处理速度达到标准模式的14倍。值得关注的是,这一性能提升并非通过切换更小的轻量模型来实现,而...

Read More
2026-08-06 talkingdev

AI语音赛道融资额一年暴涨7倍,OpenAI和谷歌押注语音成下一代AI代理核心交互界面

根据PitchBook的最新数据,全球AI语音初创公司在2026年第一季度共获得70亿美元融资,而该数字在2025年同期仅为10亿美元,同比增幅高达600%。这一爆发式增长反映出资本对语音赛道的强烈信心,背后推手是人工智能行业...

Read More
2026-08-05 talkingdev

OpenAI发布GPT-Live:仅用六个月打造全双工实时语音AI系统,对话再无延迟感

OpenAI近期公开了其最新的实时语音交互系统GPT-Live,标志着语音AI从“交替发言”正式迈入“自然共时”的新阶段。该系统以连续语音处理为核心,实现了全双工通信,彻底抛弃了传统语音助手依赖的轮流对话检测机制。在架构...

Read More
2026-08-04 talkingdev

OpenAI 实时语音架构深度揭秘:半年打造全双工GPT-Live,人机对话迈入“无间断”时代

OpenAI 近期公开了其低延迟实时语音系统 GPT-Live 的技术细节,展示了一套仅用六个月构建的全新架构。区别于传统的轮流发言模式,GPT-Live 采用了全双工语音模型,能够实现一边聆听一边发言的连续对话,大幅减少了交...

Read More
2026-07-29 talkingdev

微软推出轻量级多模态模型家族Mage:4B参数实现高效训练与部署

微软研究团队近期发布了Mage,一个专为研究场景设计的轻量级多模态模型家族。该系列模型严格遵循40亿参数的固定预算,在保持紧凑架构的同时,性能足以比肩规模大得多的开源系统。Mage包含两大核心成员:Mage-VL和Mag...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page