漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-12 talkingdev

里程碑:Google Gemini 月活跃用户突破 10 亿,跻身谷歌第 14 款十亿级产品

Google 官方宣布旗下人工智能助手应用 Gemini 已实现超过 10 亿月活跃用户,成为谷歌产品矩阵中第 14 个达成这一里程碑的应用。尽管谷歌未披露各平台的详细分布,但透露用户在 iOS 端的活跃度同样破亿,且日均生成图...

Read More
2026-08-06 talkingdev

字节跳动推出SeedRealtime:原生音视频实时交互模型,开启多模态对话新范式

字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技...

Read More
2026-07-17 talkingdev

Moonshot 发布 Kimi K3:2.8万亿参数多模态巨擘,百万Token上下文与代理编码能力全开

国内人工智能公司 Moonshot 正式推出新一代旗舰多模态模型 Kimi K3,参数规模高达 2.8 万亿,并原生支持 100 万 token 的超长上下文窗口。K3 的亮点不仅在于规模,更在于工程上的深度优化:团队针对长上下文场景大幅...

Read More
2026-05-19 talkingdev

阿里Qwen3.7预览版登陆Arena,文本与视觉双赛道排名飙升

阿里巴巴通义千问团队近日在Arena平台上发布了Qwen3.7预览版,涵盖文本和视觉两大核心能力。据悉,Qwen3.7 Max Preview在文本竞技场中位列第13名,而Qwen3.7 Plus Preview则在视觉竞技场中排名第16,显示出阿里在大...

Read More
2026-05-08 talkingdev

OpenAI再掀语音革命:发布GPT-Realtime多模态实时音频模型,开启对话式AI新纪元

OpenAI近日在API中正式推出了一系列全新的实时音频模型,标志着语音交互技术迈入了一个全新阶段。该系列包括三款核心模型:GPT-Realtime-2,专注于增强对话式推理能力,能够实现更自然、更具逻辑性的实时语音对话;G...

Read More
2026-04-20 talkingdev

Anthropic推出Claude Design:基于Opus 4.7视觉模型,AI驱动设计协作新范式

Anthropic Labs今日正式发布Claude Design,标志着生成式AI在专业视觉创作领域迈出关键一步。该产品基于Claude Opus 4.7多模态视觉模型构建,能够协助用户高效生成设计原型、商业演示文稿、营销单页等视觉内容。其核...

Read More
2026-03-19 talkingdev

开源|百度发布千帆VL系列企业级视觉语言模型,专攻文档解析与复杂视觉推理

百度近期在GitHub上开源了其企业级视觉语言模型系列——千帆VL(Qianfan-VL)。该系列模型并非通用型多模态模型的简单变体,而是针对工业场景进行了深度优化和增强的专用模型。其核心设计目标是解决企业级应用中的实际...

Read More
2025-12-10 talkingdev

开源|智谱AI发布GLM-4.6V系列多模态大模型:原生工具调用与128K上下文窗口

智谱AI近日正式开源了其新一代多模态大模型系列——GLM-4.6V。该系列包含两个关键版本:GLM-4.6V(106B)和GLM-4.6V-Flash(9B)。前者是面向云端和高性能集群场景设计的基础模型,后者则是为本地部署和低延迟应用优化...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page