xAI 推出的 Grok 4.6 在 Grok 4.5 基础上进一步聚焦长时间运行智能体以及更具挑战性的交互式与视觉任务。官方介绍,该版本在多项编码和知识型工作基准上显示出性能提升,并着重强化安全性与可用性,能够将产品构想转...
Read MoreSpecula 是一个智能体式系统,目标是自动化软件缺陷发现流程。它能够从代码中自动推导 TLA+ 规范,通过轨迹验证检查代码与规范之间的一致性,并对规范进行模型检查以发现并发缺陷;随后,它还会编写具有精确时序的集...
Read MoreQwen团队在Hugging Face发布Qwen3.8-2.4T-A95B模型。该模型基于Qwen3.5架构演进而来,重点提升编码与长时程任务处理能力,并通过改进的智能体执行机制提高任务完成可靠性。它支持SGLang、vLLM等主流部署框架,可较顺...
Read MoreAnthropic对Chrome浏览器中的Claude进行重要升级,侧边栏不再只是轻量问答入口,而是能够运行完整的Claude Cowork会话。用户可以在已登录的网页环境中让Claude读取页面内容,执行点击、输入和表单填写等操作,同时由...
Read More随着自主AI代理(如AutoGPT、LangChain Agent)的快速发展,如何让这些代理安全、可控地调用外部应用和服务,成为业界亟待解决的关键挑战。Corsair应运而生,它定位为“代理的集成层”,旨在提供一个统一的接口层,让A...
Read More在软件开发日益复杂、代码库规模持续膨胀的今天,如何高效理解跨多个仓库的代码逻辑成为开发者与AI编程助手共同面临的挑战。近日,一款名为Sourcebot的自托管工具在GitHub上引起了关注,它致力于通过复杂问答、代码...
Read More当人工智能能够自动化AI研发本身,世界会发生怎样的剧变?近期,红杉研究(Redwood Research)首席科学家瑞安·格林布拉特在一次深度访谈中探讨了递归式自我改进(RSI)这一当前AI领域最具争议的话题。他认为,一旦AI...
Read More英伟达推出了全新的Nemotron 3.5 Lightning模型和NeMo Switchyard开源库,旨在大幅降低AI代理的推理成本并提升效率。Nemotron 3.5 Lightning是一个拥有300亿参数的混合专家模型(MoE),专为高吞吐量的专用代理任务...
Read More