该观点将当前的大语言模型竞争与上世纪90年代的数据库之争进行了历史性类比,揭示了技术基础设施演进的一种深层规律。作者认为,大语言模型正沿着数据库的发展轨迹前进:从最初作为引发行业狂热的前沿技术,逐步演化...
Read MoreOpenAI 正式发布了其新一代自动化安全测试系统 GPT-Red。该系统不再依赖传统人工红队测试,而是通过大规模的自我博弈机制,让模型在对抗中持续进化。具体而言,GPT-Red 被训练成能够迭代式生成对抗性提示,系统性地...
Read More研究人员首次在实验中观察到递归自我改进(RSI)现象。他们让一个“自我研究”智能体在自主研究程序上连续运行了八天,最终该系统在预留的基准测试上击败了团队花费两年时间手工调优的测试框架。这套完全自主的系统包...
Read More微软在其Foundry平台和Copilot系列产品中已大规模部署AI代理,背后是一套精妙的工程化机制。微软核心AI产品副总裁Marco Casalaina指出,将检索建模为独立的子代理是成功的关键,这种设计让复杂任务可以分解为多个专...
Read More近日,一个名为 Ornith-1.0 的开源模型在开发者社区引起了广泛关注。该项目由 deepreinforce-ai 团队在 GitHub 上发布,其核心亮点在于专为“Agentic Coding”(自主代理编程)场景设计,并具备自我改进的能力。基于特...
Read More在人工智能领域,开放权重(open-weights)的大语言模型与闭源模型之间的性能差距一直是业界关注的焦点。近日,一项基于“人工分析基准”(Artificial Analysis benchmarks)的预测研究指出,到2026年12月3日,一款能...
Read More本文来自知名软件工程师、敏捷开发方法创始人之一 Kent Beck 的个人通讯。文章标题颇具挑衅意味,直指当今科技行业对初级开发者(n00b)的一种普遍误解:认为招聘他们进来只是为了执行具体任务。Beck 提出,相较于完...
Read MorePerplexity AI公司近日在其官方博客中披露了一项名为Brain的新型记忆系统。该系统旨在解决当前AI代理在执行复杂任务时缺乏上下文和长期记忆的痛点。Brain通过构建一个跨任务、项目、决策、文件和资料源的持续上下文...
Read More