Spotify 工程团队披露,其内部工具 Portal 通过特定模式与 Claude Code 插件,将大文件读取和可预测的代码生成任务从 Claude Code 转移至成本更低的 Gemini 2.5 Flash worker。该机制利用 hooks 对超过大小阈值的文...
Read MoreTypeScript模式声明与校验库Zod发布4.5版本,针对长期存在的内存占用问题进行了关键优化。此前,Zod会为每个schema实例预先绑定并附加数十个闭包方法,导致即使是一个简单的z.string()也会在堆中保留约7.5KB内存。4....
Read More近日,OpenAI 发布内部观察,披露其研究流程正被编码智能体(coding agents)深度重塑。研究人员更频繁地调用编码智能体,自动生成代码并执行实验,实验迭代速度显著提升,使研究者能够将更多精力转向更复杂、更高阶...
Read MoreSalesforce AI Research 发布了 Random Attention 代码仓库,对应论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》。在大语言模型推理中,KV缓存占用大量显存,现有方法通常依赖学...
Read MoreLLM-as-a-Verifier 是一个通用验证框架,其核心思路是让大语言模型直接充当“验证器”,在不引入额外训练的情况下,为任意智能体(agent)提供细粒度、可操作的反馈。该框架在编码、机器人和医学智能体等基准测试中均...
Read MoreOpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...
Read MoreAnthropic宣布其AI系统Claude在Lean证明助手中仅用11天,就完成了费马大定理的首个完整计算机可验证证明。该定理由Andrew Wiles于1995年首次给出手工证明,其形式化验证长期被视为极其复杂的工作。Claude生成的证明...
Read MoreGrok 正式发布 Imagine Video 1.5 智能体,标志着其在视频生成领域再次推进。该版本由 Grok 最新的 Image 2.0 模型提供支持,在画面质量与叙事表达上相较此前版本均有提升,尤其强化了多镜头之间的连接能力,使镜头...
Read More