漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-03 talkingdev

谷歌发布 Gemini 3.8 Flash 与 Flash Cyber:智能体推理和网络安全能力再升级

谷歌近日正式推出 Gemini 3.8 Flash,这一新模型在编程、智能体工作流和多步推理方面均有显著提升,同时延续了与 3.7 Flash 相同的入门定价,意味着开发者可以在不增加成本的情况下获得更强的任务执行能力。值得关注...

Read More
2026-08-25 talkingdev

NVIDIA Groq 3 LPX AI推理加速芯片全面量产,Vera Rubin迎来史上最快Token生成速度

NVIDIA的Groq 3 LPX AI推理加速芯片现已进入全面量产阶段。Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,显著提升了AI推理能力,能够为响应敏感型智能体(Agentic)工作负载提供超高速的Token生成表现。在面向智...

Read More
2026-07-17 talkingdev

Moonshot 发布 Kimi K3:2.8万亿参数多模态巨擘,百万Token上下文与代理编码能力全开

国内人工智能公司 Moonshot 正式推出新一代旗舰多模态模型 Kimi K3,参数规模高达 2.8 万亿,并原生支持 100 万 token 的超长上下文窗口。K3 的亮点不仅在于规模,更在于工程上的深度优化:团队针对长上下文场景大幅...

Read More
2026-07-12 talkingdev

NVIDIA强调开放与合成数据对AI智能体的关键作用

NVIDIA近期通过一篇官方博客深入探讨了数据在构建强大AI智能体中的核心地位,明确指出开放数据和合成数据是推动下一代AI发展的关键要素。随着AI系统日益复杂,特别是需要具备推理、规划和工具调用等高级能力的智能体...

Read More
2026-07-12 talkingdev

马斯克旗下SpaceXAI发布Grok 4.5:专攻编码、智能代理与知识工作的最强模型

埃隆·马斯克旗下的人工智能公司SpaceXAI正式推出了新一代大语言模型Grok 4.5,将其定位为公司在编码、智能代理任务和知识工作领域的最强模型。官方披露,该模型在训练过程中与流行AI编程工具Cursor进行了深度协同优...

Read More
2026-05-29 talkingdev

Agent Judge:为生产级智能体打造的长上下文评测新范式

在生产环境中部署基于大语言模型(LLM)的智能体(Agent)时,如何准确评估其在复杂、长上下文任务中的表现一直是个难题。传统LLM评测员(Judge)在处理涉及多步推理、状态验证和动态调整的Agent轨迹时,常出现事实...

Read More
2025-08-19 talkingdev

API自动转换MCP工具存在三大缺陷,开发者需重新审视LLM工具设计范式

MCP(Model Context Protocol)已成为为大语言模型集成第三方工具的事实标准,但近期开发者社区发现直接将现有API自动转换为MCP工具的方案存在显著局限性。关键技术痛点体现在三个方面:智能体面对大量工具时会出现...

Read More
2025-06-17 talkingdev

[论文推荐]TreeRL:无需奖励模型的LLM训练新方法,数学与代码推理能力显著提升

TreeRL是一种创新的语言模型训练方法,通过结合on-policy树搜索和中间监督机制,实现了无需单独奖励模型的LLM训练。这一技术突破来自最新arXiv论文,相比传统的ChainRL方法,TreeRL在数学推理和代码生成等复杂任务上...

Read More
  1. Next Page