漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-28 talkingdev

Cohere发布Parse文档智能模型:支持9种语言,每千页仅1.5美元

Cohere 推出 Parse 文档智能解析服务,可将复杂多模态文件(如文档、表格、图像)转换为结构化、机器可读的数据。该服务基于高成本效益的视觉语言模型,面向企业大规模文档处理场景,能够检测并理解关键视觉元素,并...

Read More
2026-08-27 talkingdev

Meta推出Muse Image图像生成模型:先推理后渲染,单图成本仅0.01美元

Meta推出的Muse Image图像生成模型,其核心特点在于能够基于搜索结果进行图像生成,并在最终渲染前执行推理过程。这意味着模型不再仅依赖训练数据中的视觉模式,而是可以结合外部信息来约束生成结果,有望提升图像的...

Read More
2026-08-14 talkingdev

空货架还是丢钥匙?谷歌研究:GPT-5与Gemini 3事实性错误的瓶颈在“回忆”

大模型事实性错误常被简单归因为训练知识不足,但谷歌研究团队通过知识画像框架对Gemini 3、GPT-5等先进模型进行分析后发现,模型对事实知识的编码已接近饱和,真正的瓶颈出现在参数化回忆阶段。也就是说,模型并非...

Read More
2026-07-30 talkingdev

Liquid AI 发布 LFM2.5-Encoders:在 CPU 上实现高效长上下文推理,打破硬件限制

人工智能初创公司 Liquid AI 近日发布了全新的 LFM2.5-Encoders,这是一系列专门为在 CPU 上执行高效文档级推理而设计的编码器模型。随着企业级应用对长文本处理的需求激增,摆脱对昂贵 GPU 的依赖、实现低成本的边...

Read More
2026-03-18 talkingdev

Mistral AI发布Forge平台:企业可基于私有数据从头训练前沿AI模型

法国人工智能公司Mistral AI正式推出了名为“Forge”的全新平台,旨在为企业和政府机构提供构建定制化AI模型的解决方案。该平台的核心特点是允许客户完全基于自身的专有数据,从头开始训练前沿级别的AI模型,而非仅仅...

Read More
2026-03-11 talkingdev

开源|RCLI:完全本地的macOS语音AI助手,无需云端即可控制电脑与文档问答

近日,GitHub上开源项目RCLI引发开发者社区关注。该项目是一款专为搭载Apple Silicon芯片的macOS设备设计的全本地化语音AI助手。其核心价值在于构建了一个完整的端侧AI处理流水线,集成了语音识别(Speech-to-Text)...

Read More
2026-03-11 talkingdev

开源|RCLI:本地化语音AI助手登陆macOS,无需云端即可控制应用与查询文档

近日,GitHub开源项目RCLI(RunanywhereAI/RCLI)发布,为macOS用户带来了一款完全在设备端运行的语音人工智能助手。该工具的核心创新在于其“全本地化”架构,集成了本地语音AI与检索增强生成(RAG)技术,用户可直接...

Read More
2026-03-11 talkingdev

谷歌发布Gemini Embedding 2:首个统一多模态嵌入模型,支持超百种语言

谷歌近日正式推出了其新一代多模态嵌入模型Gemini Embedding 2,标志着人工智能在跨模态语义理解领域迈出了关键一步。该模型通过Gemini API和Vertex AI平台提供服务,其核心突破在于首次将文本、图像、视频、音频及...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page