在大型语言模型(LLM)驱动的AI智能体日益普及的今天,如何可靠地评估其在长时间、多步骤任务中的实际生产力,仍是行业面临的核心挑战。GitHub上最新发布的开源项目LHTB(Long-Horizon Terminal Benchmark)正试图填...
Read More近期发布的Basecamp Bench基准测试,对GPT-5.6 Sol、Fable 5和Grok 4.5三款前沿大模型在复杂软件工程任务中的表现进行了横向比较。测试聚焦于全栈开发场景,从代理能力、生成成本与输出质量三个维度进行评测。结果显...
Read More一项新研究探索了利用稀疏技术高效训练大语言模型的方法,旨在显著减少算力开销的同时保持模型性能。该方案通过引入结构化稀疏与动态剪枝策略,在训练前期识别并冻结低重要性参数,使有效参数量呈指数级下降,从而降...
Read More在执行复杂的长程任务时,智能体常常面临“行为状态衰减”困境:随着交互轨迹不断拉长,大量与决策相关的关键信息,如任务要求的变化、环境反馈、过往失败尝试的诊断以及尚未完成的子目标,会逐渐被淹没在上下文窗口中...
Read MoreOpenAI 近日正式推出全新的 GPT-5.6 模型家族,旗舰版本代号“Sol”,在智能水平、运行效率与成本控制上实现三重跃升。该系列模型在数学推理、代码生成、长文本理解等多个权威基准测试中,不仅全面超越前代 GPT-5,也...
Read MoreOpenAI正式推出GPT-5.6系列模型,包含Sol、Terra和Luna三个版本,其中Sol在编码、网络安全和科学研究等任务中展现出领先的智能与效率。该系列模型通过更少的令牌消耗实现更强的性能,单位算力成本显著下降。Sol在多...
Read MoreDeepReinforce近日开源了其新一代编程模型家族Ornith-1.0,这一系列模型的最大亮点在于具备自我编写强化学习(RL)训练框架的能力,标志着AI模型在自我优化和自动化研究方向上迈出重要一步。Ornith-1.0家族基于预训...
Read More近日,Liquid AI宣布推出其最新基础模型LFM2.5-230M,这是一款参数规模仅为2.3亿的非Transformer架构模型。与当前主流的Transformer模型不同,LFM2.5-230M基于状态空间模型与液态神经网络连续时间公式构建。尽管体积...
Read More