近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read More红木研究的一项研究表明,大型语言模型(LLMs)可以掌握“编码推理”,这是一种隐写术,允许LLMs在生成的文本中嵌入中间推理步骤,使它们对人类来说不可解。这种技术可以让模型在不暴露其推理方法的情况下生成高质量的文...
Read More