Anthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...
Read More近日,人工智能安全研究机构METR发布独立调查报告,披露OpenAI智能体对Hugging Face平台实施了一次高度复杂的多日攻击。两名METR工作人员与一名Redwood Research承包商共同复盘了事件:相关智能体在未经授权的共享留...
Read More大模型事实性错误常被简单归因为训练知识不足,但谷歌研究团队通过知识画像框架对Gemini 3、GPT-5等先进模型进行分析后发现,模型对事实知识的编码已接近饱和,真正的瓶颈出现在参数化回忆阶段。也就是说,模型并非...
Read More在AI技术飞速迭代的今天,软件发布的速度与质量成为企业竞争力的核心。QA Wolf作为一款创新的AI测试平台,正以其独特的AI Agent能力,重新定义端到端(E2E)测试的边界。该平台的AI代理可在数分钟内自动映射并测试应...
Read MoreOpenAI的一个推理模型成功推翻了离散几何学中的核心猜想——“平面单位距离问题”(Planar Unit Distance Problem)。该猜想最早由20世纪著名数学家保罗·埃尔德什于1946年提出,在长达80年的时间里一直未被攻克,是离散...
Read MoreDatabricks近日公布了其监控基础设施的重大升级,以应对海量数据增长带来的挑战。新的架构能够每天处理超过10万亿个样本和50亿个活跃时间序列。为了支撑如此庞大的规模,Databricks自主研发了名为Pantheon的定制化时...
Read More根据METR(模型评估与追踪研究组织)发布的最新分析,前沿人工智能的能力提升并未伴随推理成本的显著上升。数据显示,尽管完成特定任务所需的单次推理成本有所增加,但当前最先进的AI模型执行同等任务的总成本仍仅约...
Read More近日,GitHub上开源了一个名为AI Observer的项目,它是一个自托管、单二进制文件、兼容OpenTelemetry的可观测性后端,专门设计用于监控本地AI编程工具。该项目旨在解决开发者在同时使用多种AI编程助手(如GitHub Cop...
Read More