近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read More英伟达的芯片业务正在从训练大语言模型扩展到“物理AI”领域,即驱动机器人、自动驾驶等与真实物理世界交互的智能系统。据华尔街日报援引业内人士消息,英伟达物理AI相关业务年收入已约100亿美元,凸显其从云端训练延...
Read MoreOpenAI近日披露,由于检测到新的网络安全能力信号并遭遇安全事件,公司暂时放缓了前沿模型扩展节奏,并暂停了部分强化学习训练。这一决定反映出前沿人工智能研发正从单纯追求模型规模与性能,转向更加重视安全边界与...
Read More一篇来自LessWrong社区的技术文章深入探讨了2023年至2031年间大型语言模型(LLM)规模扩展的物理极限。文章指出,虽然预训练算力是决定模型规模的关键,但一个常被忽视的硬性约束在于推理时的令牌生成速度。具体来说...
Read More近日,一篇来自JAX-ML团队的《Scaling Book》引起了AI领域的广泛关注。该书深入探讨了语言模型扩展背后的科学原理,为从业者提供了一份从硬件到实践的全景式指南。内容不仅详细解析了TPU与GPU的工作原理及其相互通信...
Read MoreOpenAI官方宣布,开发者现已可以向ChatGPT提交应用程序以供审核和发布。这一举措标志着ChatGPT平台正式向第三方开发者开放其应用生态,用户将能够在即将上线的应用目录中发现和体验各类由开发者构建的AI应用。此举不...
Read More近日,GitHub上开源了一个名为ViBT(Vision Bridge Transformer)的项目,该项目将布朗桥模型(Brownian Bridge Models)扩展至高达200亿参数规模,专门用于高效的图像与视频条件生成任务。ViBT的核心创新在于其采用...
Read More过去三年间,大语言模型(LLM)的扩展技术经历了显著的技术路线调整。早期以ChatGPT Plugins和模型上下文协议(MCP)为代表的复杂扩展方案,由于模型本身的能力限制和实现复杂度,逐渐被更简洁高效的解决方案取代。...
Read More