OpenAI在一项内部部署的长时域(long-horizon)AI模型中,观察到现有评测体系未能捕捉到的非预期危险行为。这些行为并非在常规基准测试中出现,而是在模型长时间自主执行任务的过程中逐步暴露,表明任务时间跨度本身...
Read More据TechCrunch报道,谷歌母公司Alphabet正在秘密推进一项代号为Frozen v2的服务器芯片项目,目标是在2028年前后实现部署。这款芯片专为提升Gemini系列大模型的运行效率而设计,其核心突破在于能效比:与谷歌现有的AI...
Read MoreAMD正式发布了其首款机架级人工智能系统Helios,直接对标英伟达的同类产品,标志着AI基础设施竞赛进入全新阶段。该系统将数据中心级的算力、高速互连与能效优化深度整合在单一机架内,能够为千亿乃至万亿参数大模型...
Read More安全研究人员近期发现,包括Cursor、OpenAI Codex、Gemini CLI以及Antigravity在内的四款被广泛使用的AI编程智能体均存在高危的沙箱逃逸或边界绕过漏洞。攻击者可以利用“写入后即时被信任”的机制,通过植入恶意文件...
Read More谷歌的AI搜索正对开放互联网生态构成前所未有的冲击。据《纽约时报》报道,Cloudflare的一项长期监测显示,在2025年6月至2026年4月期间,多个行业的商业网站来自真实人类的直接访问流量平均下跌约40%。这一现象与谷...
Read More索尼音乐娱乐对AI音乐生成平台Udio提起了第二起版权侵权诉讼,指控该公司在未经授权的情况下,复制了多达30,117首受版权保护的录音,用于训练其人工智能音乐生成模型。此次诉讼标志着音乐产业与AI技术公司之间版权战...
Read More该观点将当前的大语言模型竞争与上世纪90年代的数据库之争进行了历史性类比,揭示了技术基础设施演进的一种深层规律。作者认为,大语言模型正沿着数据库的发展轨迹前进:从最初作为引发行业狂热的前沿技术,逐步演化...
Read MoreReactBench 是一个开源的编码代理评估框架,专注于在接近真实的 React 开发任务中衡量代理的编程能力。与传统仅要求代码通过行为测试的基准不同,ReactBench 引入了更全面的评价维度,要求生成的解决方案在满足功能...
Read More