OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...
Read MoreOpenAI正经历一轮剧烈的组织重构。在多位高管陆续离职、公司又深陷与联合创始人埃隆·马斯克的诉讼拉锯之际,总裁Greg Brockman的职责显著扩大,开始直接掌控产品团队与扩展(scaling)团队。这一安排不仅是人事层面...
Read More计算机科学家梅拉妮·米切尔认为,当前对人工智能“智能”的讨论常常陷入拟人化误区。她指出,大语言模型表现出的对话、推理和解题能力,并不意味着它们像人类一样思考或理解,而更像一种“异类智能”。为了更准确地衡量...
Read More近日,阿里巴巴Qwen研究实验室正式发布Qwen 3.8 27B,这是一款采用Apache 2.0许可的270亿参数开源大语言模型,开放权重约17GB。据知名开发者Simon Willison介绍,该模型在中等参数规模下集成了长上下文处理、高效工...
Read More根据人工智能分析机构Artificial Analysis的最新排名,全球排名前十的文生视频模型中,中国AI实验室占据了其中九席,展现出在视频生成领域压倒性的技术集群优势。彭博社评论指出,过去一段时间,外界对中国人工智能...
Read More谷歌及其母公司Alphabet正在进行新一轮AI战略更新。首席执行官桑达尔·皮查伊分享了Gemini系列模型成功落地的信息,并指出用户在各类AI应用中的参与度正快速增长,显示出谷歌在生成式AI领域的布局已从技术储备转向大...
Read More谷歌母公司Alphabet旗下最核心的人工智能部门Google DeepMind发生剧烈人事震荡。联合创始人Demis Hassabis正式卸任日常管理职务,转任Google DeepMind主席及Alphabet首席科学家,这一角色转换意味着他将从强执行的科...
Read MoreEpoch AI推出了名为MirrorCode的基准测试,专门用于评估人工智能在长周期编程任务中的自主重写能力。该基准要求AI模型在完全无法访问原始源代码的情况下,从零开始重新实现完整的软件程序,以此衡量AI在复杂、持续性...
Read More