WebLLM 是 MLC AI 推出的高性能浏览器端大语言模型推理引擎,它借助 WebGPU 将开源模型的加载与推理全过程放在用户浏览器内完成,不需要后端服务器。该项目提供兼容 OpenAI 的 API,可支持流式输出、JSON 模式等聊天...
Read MoreThree-LLM 项目展示了一种全新的浏览器端大模型推理路径:它将 GPT-2、SmolLM2、Qwen 和 Phi 等模型的推理图,直接翻译为 Three.js TSL 计算着色器,并借助 WebGPU 在本地完成计算。与常见方案不同,它不需要服务端...
Read MorePerplexity正式发布Portable Computer,这是其智能体计算平台的一个本地化版本,目标是将AI代理任务完全运行在用户自有硬件上。该方案与Nvidia合作,可部署在DGX Spark及RTX系列Linux设备上,模型、用户数据和工作内...
Read MoreMunder Difflin 是一个本地运行的多智能体编排桌面应用,能够将多个终端代理命令行工具(terminal-agent CLIs)作为可自我协调的智能实体进行统一管理。其核心架构由名为 Michael 的中央监督代理负责调度与协调,使...
Read MoreMeta旗下超级智能实验室正式推出Muse Glimmer,一个拥有300亿参数的开源智能体模型,采用Apache 2.0许可证。该模型专为消费级硬件上的常驻本地工作流优化,重点面向编程、函数调用和模型评估等场景,并展现出强大的...
Read More近日,开源推理引擎WASTE正式亮相,其核心亮点在于能够运行权重规模远超宿主设备物理内存的模型。该引擎作为让强大模型在更多硬件上可用的初步举措,旨在为个人和机构在基础设施成本、数据隐私、可用性及部署方式上...
Read MoreEschaLabs 近日发布了 Escha-W2,这是对 Qwen3.6-35B-A3B 混合专家(MoE)模型进行 2 比特量化后的构建版本。Qwen3.6-35B-A3B 本身是一个包含 256 个专家的庞大架构,总参数量达到 35B,但在每次推理中仅激活 3B 参...
Read More人工智能领军人物吴恩达(Andrew Ng)在GitHub上开源了一个名为OpenWorker的新项目。该项目旨在构建一个运行在本地桌面端的AI同事,它能够理解用户指令,自主跨越不同的文件、文件夹乃至桌面应用程序来执行复杂工作...
Read More