QuestDB 在其最新的博文中深入探讨了数据库基准测试中常见的误导性问题。作为一款开源的高性能时序数据库,QuestDB 以超低延迟和高吞吐量著称。然而,其研究指出,基准测试结果极易受到测试方法的影响。例如,进程持...
Read MoreGLM-5.2的发布看似是一次增量更新,但其在基准测试和训练方法上的细微调整,却意外打开了广泛的全新用例。该模型在作为通用智能体应用于编码框架时表现尤为出色,展现出了极高的适应性和实用性。许多AI社区的研究者...
Read MoreIBM Research在Hugging Face博客上发布了其最新的开源项目CUGA(Conversational Universal Generative Agent),这是一个轻量级的智能体(Agent)应用开发框架。CUGA通过统一管理规划、执行和状态维护等复杂环节,极...
Read More最新发布的开源大语言模型GLM-5.2在多项基准测试中展现出令人瞩目的性能,一举超越当前所有同级别开源模型,成为开源社区的新标杆。该模型在逻辑推理、代码生成以及多语言理解等关键领域表现尤为突出,其评测分数甚...
Read MoreZ.ai 最新发布了其AI模型 GLM-5.2,这是一次面向编码领域的重大升级。该模型拥有高达 100 万 token 的超大上下文窗口,能够处理整个代码库的长程编码任务,并引入了新的推理控制机制。GLM-5.2 目前已向 Coding Plan...
Read More国内AI初创公司Moonshot AI于本周正式发布了其K2编程模型家族的最新开源版本——Kimi K2.7-Code。据该团队宣称,与上一代K2.6相比,新模型在保持高性能的同时,实现了推理过程中令牌(token)使用量降低30%的显著突破...
Read More小米近日在AI编程助手领域取得了突破性进展,正式开源了其终端原生AI编码工具——MiMo Code V0.1.0。这款工具在关键AI编码基准测试中表现抢眼,特别是在涉及超长周期、多步骤的复杂任务(超过200步)上,性能超越了知...
Read More在当前AI编程模型的评估中,大多数基准测试都聚焦于代码能否正确运行,即是否能够通过编译、执行并输出预期结果。然而,在真正的软件开发生产环境中,“正确”仅仅是最低标准。最新发布的FrontierCode基准测试,首次将...
Read More