漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-20 talkingdev

阿里巴巴在WAIC开源AI芯片软件栈,剑指英伟达CUDA生态锁定

阿里巴巴旗下半导体公司平头哥在世界人工智能大会(WAIC)上宣布,开源其玄铁系列AI芯片的软件栈SAIL。这一举措旨在降低开发者从英伟达CUDA生态迁移的门槛,直指当前AI算力领域被CUDA深度绑定的行业痛点。长期以来,...

Read More
2026-07-19 talkingdev

阿里开源芯片软件栈,联手华为、摩尔线程挑战英伟达CUDA生态霸权

阿里巴巴旗下芯片公司平头哥正式将其AI计算软件平台开源,力图降低开发者向“镇岳”AI计算架构迁移的门槛。这一举动紧跟华为昇思MindSpore与摩尔线程MUSA软件栈的开源步伐,标志着中国GPU厂商正合力构建自主可控的通用...

Read More
2026-02-23 talkingdev

开源|突破显存限制:开发者实现单张RTX 3090运行Llama 3.1 70B,NVMe直连GPU绕过CPU

近日,在GitHub上开源名为“ntransformer”的高效大语言模型推理引擎项目,其核心创新在于探索并实现了通过NVMe存储设备直接与GPU通信,绕过CPU和系统内存的传统数据路径,从而在消费级显卡RTX 3090上成功运行了参数量...

Read More
2026-02-18 talkingdev

开源|BarraCUDA:瞄准AMD GPU的开源CUDA编译器,可将.cu文件编译为GFX11机器码

近日,一个名为BarraCUDA的开源项目在开发者社区引发广泛关注。该项目旨在实现一个能够将NVIDIA CUDA代码(.cu文件)直接编译为AMD GPU(特别是基于RDNA 3架构、代号GFX11)机器代码的编译器。这一尝试打破了长期以...

Read More
2025-12-18 talkingdev

谷歌联手Meta推出TorchTPU,剑指英伟达AI软件护城河

谷歌与Meta正联手推进一项关键合作,旨在通过名为“TorchTPU”的新项目,大幅提升谷歌自研的张量处理单元(TPU)对PyTorch深度学习框架的原生支持能力。此举的核心目标是削弱英伟达凭借其CUDA软件生态在AI计算市场建立...

Read More
2025-12-03 talkingdev

亚马逊发布第三代AI训练芯片Trainium3,性能大幅提升并展示兼容英伟达路线图

亚马逊云科技(AWS)在自研AI芯片领域持续发力,近日正式发布了其第三代AI训练专用芯片——Trainium3。这款芯片在性能规格上表现亮眼,标志着AWS在降低AI计算成本、提供多元化算力解决方案方面迈出了重要一步。值得注...

Read More
2025-09-08 talkingdev

分布式GPU运行时竞赛:英伟达与AMD角逐数据中心新战场

随着数据规模呈指数级增长,单GPU服务器的内存与显存容量已无法满足超大规模AI与数据分析需求。行业巨头英伟达与AMD正竞相攻克集群级数据调度技术壁垒,旨在通过软件生态构建竞争优势。初创公司Voltron Data推出的Th...

Read More
2025-08-25 talkingdev

突破跨架构部署难题:Kernel-builder库实现生产级CUDA内核开发

近日,开源社区推出革命性工具库Kernel-builder,专门用于构建和部署跨硬件架构的自定义CUDA内核。该工具通过提供完整的开发框架,显著降低了高性能计算内核从开发到生产环境部署的技术门槛。根据技术文档介绍,开发...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page