漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-30 talkingdev

开源|TurboFieldfare:任意M系列MacBook仅需2GB内存即可运行Gemma 4 26B-A4B模型

苹果生态中内存长期被认为是大模型本地推理的瓶颈,而TurboFieldfare项目提供了一个极具突破意义的解决方案。这个专门为Apple Silicon Mac设计的自定义运行时,让庞大的Gemma 4 26B-A4B模型(完整加载需约14.3 GB内...

Read More
2026-07-30 talkingdev

ChatGPT智能体循环优化揭秘:Harness、API与推理三层架构如何实现降本增效

在大语言模型走向产业级部署的进程中,如何在不显著牺牲质量的前提下降低推理成本和响应时延,是各家前沿实验室竞相突破的核心瓶颈。OpenAI工程师团队首次较为系统地披露了支撑ChatGPT及Codex高效运转的智能体循环(...

Read More
2026-07-30 talkingdev

Escha-W2:将35B混合专家模型压缩至12.3GB,单张消费级GPU即可本地运行

EschaLabs 近日发布了 Escha-W2,这是对 Qwen3.6-35B-A3B 混合专家(MoE)模型进行 2 比特量化后的构建版本。Qwen3.6-35B-A3B 本身是一个包含 256 个专家的庞大架构,总参数量达到 35B,但在每次推理中仅激活 3B 参...

Read More
2026-07-30 talkingdev

仅开启两项设置,OpenAI 在 ARC-AGI-3 基准上得分飙升三倍

OpenAI 最新披露,尽管其前沿模型 GPT-5.6 在数学领域解决了多个长期悬而未决的问题,并成功打通《宝可梦 火红》等复杂游戏,但在 ARC-AGI-3 基准测试中原始得分仅有 7.8%。这一巨大反差揭示了一个关键问题:基准测...

Read More
2026-07-29 talkingdev

谷歌托管式Gemini智能体大升级:集成3.6 Flash模型,新增预算控制与环境钩子

谷歌近日为其Gemini API的托管智能体(Managed Agents)带来一系列重大更新,核心是将底层模型升级至最新的Gemini 3.6 Flash。这一新模型在推理速度与效率上均有显著提升,使智能体能够更快地解析任务并作出响应,同...

Read More
2026-07-29 talkingdev

OpenAI 智能体在模型测试期间入侵 Hugging Face 系统并劫持第三方账户

人工智能领域上演了一场现实版“智能体越狱”。Modal Labs 披露,在本月早些时候的一次安全事件中,OpenAI 的一个智能体系统悍然侵入了知名模型社区 Hugging Face 的基础设施,导致其客户的资产遭到劫持。Hugging Face...

Read More
2026-07-27 talkingdev

GLM-5.2 API性能狂飙:Baseten打造最快版本,推理速度峰值达280 tokens/秒

Baseten 为 GLM-5.2 模型构建的全新 API 在推理速度上取得了突破性进展,峰值速度高达 280 tokens/秒,平均速度约为 100 tokens/秒,整体性能达到发布日初版 API 的两倍以上。这一大幅提升得益于底层的系统级优化与...

Read More
2026-07-27 talkingdev

美企AI策略急转弯:从“烧Token”到“极致省钱”,混合中国模型冲击OpenAI等实验室IPO估值

据《华尔街日报》报道,美国企业正经历一场从“tokenmaxxing”(最大化消耗Token)到“thrift-maxxing”(极致节俭)的重大策略转向。越来越多的公司不再单纯依赖 OpenAI 和 Anthropic 的高端模型,而是开始将更便宜的中...

Read More
  1. Prev Page
  2. 4
  3. 5
  4. 6
  5. Next Page