漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-03 talkingdev

开源|smevals:专为小模型和大模型设计的AI评估框架

在大语言模型竞争日益激烈的当下,如何科学、标准化地衡量不同规模模型的能力上限正成为一个核心议题。Prime Radiant公司近日开源的smevals评估框架正是瞄准了这一痛点,它提供了一套轻量且专为小模型和大模型运行基...

Read More
2025-03-25 talkingdev

[论文推荐] LLaVA-MORE:多模态大语言模型的系统性评估框架

LLaVA-MORE 是一项关于多模态大语言模型(Multimodal Large Language Models, MLLMs)的系统性研究,旨在评估不同语言模型和视觉骨干网络在 MLLMs 中的表现,并提供一个可复现的框架来比较这些架构。通过该研究,研...

Read More