漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-05 talkingdev

论文推荐|DiffusionGemma:基于离散扩散的超高速语言模型,单卡H100每秒生成1500 Token

来自Google的研究团队发布了DiffusionGemma技术报告,提出了一种实验性的开源权重语言模型,通过离散扩散生成文本,速度远超传统自回归模型。DiffusionGemma并未从零训练,而是在专家混合架构Gemma 4(激活参数38亿...

Read More
2026-08-03 talkingdev

开源|Google Chrome Labs 发布 use-webmcp-tool:让浏览器 AI 智能体按需调用你的 React 工具函数

Google Chrome Labs 近日在 GitHub 上开源了一个名为 use-webmcp-tool 的 React Hook,旨在通过实验性的 WebMCP 规范,将应用内部功能以可调用工具的形式暴露给运行在浏览器端的人工智能智能体。该项目的核心创新在...

Read More
2026-07-31 talkingdev

谷歌DeepMind推出Gemini Robotics ER 2,重新定义机器人视频理解与多机协作

谷歌DeepMind正式发布了新一代机器人AI系统Gemini Robotics ER 2,该系统在视频理解、工具编排和多机器人协作方面实现了阶跃式突破。ER 2将先进的Gemini大语言模型与机器人深层控制相结合,使机器人不仅能够更精准地...

Read More
2026-07-30 talkingdev

谷歌Flow Music迎来Lyria 3.5:音乐、歌词与人声生成全面进化

谷歌在其AI音乐生成平台Flow Music中正式推出最新模型Lyria 3.5,标志着AI音乐创作能力再次迈上新台阶。作为Lyria系列的重大迭代,3.5版本在音乐性、歌词生成和人声质感三大核心维度上均实现显著提升,能够生成更富...

Read More
2026-07-29 talkingdev

谷歌托管式Gemini智能体大升级:集成3.6 Flash模型,新增预算控制与环境钩子

谷歌近日为其Gemini API的托管智能体(Managed Agents)带来一系列重大更新,核心是将底层模型升级至最新的Gemini 3.6 Flash。这一新模型在推理速度与效率上均有显著提升,使智能体能够更快地解析任务并作出响应,同...

Read More
2026-07-28 talkingdev

谷歌云发布Gemini蒸馏服务:用gemini-2.5-flash复现大模型推理能力

谷歌云在Gemini企业智能体平台上正式推出Gemini蒸馏服务(Gemini Distillation Service),旨在通过大型“教师”模型的输出和推理路径,训练出更小、更高效的“学生”模型。该服务专门针对高吞吐量、低延迟严苛要求的应...

Read More
2026-07-24 talkingdev

微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash:高保真图像生成和超低延迟语音模型正式公开预览

微软正式推出两款全新自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,进一步强化其在多模态生成领域的布局。MAI-Image-2.5-Pro专注于高保真图像生成与编辑,能够根据复杂文本描述生成细节丰富、构图精准的高质...

Read More
2026-07-24 talkingdev

Claude语音模式重大更新:支持Opus等全系列模型,并打通Gmail、Slack等办公应用

Anthropic为其AI助手Claude的语音模式推出了一次重要升级,显著提升了实用性和场景覆盖。本次更新最大的变化是模型支持范围的扩展:用户现在可以在语音交互中自行选择使用Claude Opus、Sonnet或Haiku模型,从而根据...

Read More
  1. Prev Page
  2. 3
  3. 4
  4. 5
  5. Next Page