一项针对开源模型推理通道的预填充实验引发关注。研究者将GPT-5.5 Pro推理轨迹的开头部分作为预填充内容,注入多个开源模型的推理过程,再测量模型输出与教师模型可见答案的重叠程度。结果显示,Qwen3.8 A95B的重叠...
Read MoreNVIDIA研究团队最新发布了并行解码蒸馏(Parallel Decoding Distillation)技术,该方法通过在一次模型评估中同时预测多个去噪步骤,显著减少了扩散模型在图像和视频生成时所需的迭代次数。不同于传统需要数十甚至上...
Read More谷歌云在Gemini企业智能体平台上正式推出Gemini蒸馏服务(Gemini Distillation Service),旨在通过大型“教师”模型的输出和推理路径,训练出更小、更高效的“学生”模型。该服务专门针对高吞吐量、低延迟严苛要求的应...
Read More人工智能公司 Anthropic 近日正式阐述了其对开放权重模型(open-weight models)的官方立场,明确表示并未倡导对这类模型实施全面禁令。公司认为,能力相对有限的开放权重模型具有公共品属性,能够促进学术研究、透...
Read More人工智能安全与研究公司Anthropic近日公开披露,其检测到并成功阻止了针对其旗舰AI模型Claude的大规模“知识蒸馏”攻击。Anthropic指控中国AI公司深度求索(DeepSeek)、月之暗面(Moonshot AI)以及MiniMax创建了超过...
Read More近日,由D2I-ai团队在GitHub上开源的DASD(序列蒸馏)项目,提出了一种创新的模型蒸馏流程,旨在训练出更紧凑、高效的模型以应对复杂的推理任务。该流程整合了温度调度学习与发散感知采样等前沿技术,通过精细化的知...
Read More人工智能领域知名专家安德烈·卡帕西(Andrej Karpathy)近期发布了其对2025年大语言模型(LLM)发展的年度回顾,系统性地梳理了行业在过去一年中经历的深刻范式转变。报告指出,技术演进的核心驱动力已从单纯追求模...
Read More开发者Sean Goedecke在最新实验中证实,OpenAI的GPT-5-Codex在人工智能研究领域展现出超越人类研究员的潜力。通过构建自动化研究流程,Codex能够自主设计实验方案并根据结果持续优化策略,特别是在文本生成领域取得...
Read More