近年来,以DuckDB为代表的嵌入式分析引擎正在改变数据处理的基本范式。过去,大规模数据分析往往依赖由多台机器组成的分布式系统,以应对数据量和计算复杂度的挑战。然而,随着单机硬件性能的显著提升,尤其是内存容...
Read MoreDeno团队正式开源了一款名为Celld的后台守护进程,为开发者带来了革命性的自托管能力。该项目旨在将类似Cloudflare Durable Objects的分布式有状态计算,以及Cloudflare Workers的边缘函数运行环境,完整迁移到个人...
Read MorePlanetScale 最新公布的博客揭示了其面向分片 Postgres 数据库的大规模并行备份架构。该方案专为处理 PB 级数据规模而设计,能够在数小时内完成跨分片的一致性加密快照,且每 12 小时自动执行一次,对线上生产查询的...
Read MoreHugging Face 团队近日发布了一项名为“Delta Weight Sync”的创新技术,旨在解决大规模强化学习(RL)训练中的通信瓶颈问题。在训练拥有万亿参数量的模型时,传统的权重同步方式需要在训练器(Trainer)和推理引擎(I...
Read More开发者Russell Romney在Rust中构建了一个名为Turbolite的实验性SQLite虚拟文件系统(VFS),旨在探索对象存储(如AWS S3)是否已足够快速以支持云端嵌入式数据库的直接查询。该系统专为处理大量“冷”数据库(例如按租...
Read More近日,开源项目JuiceFS在技术社区引发广泛关注。该项目是一个基于Redis和对象存储(如Amazon S3)构建的分布式POSIX文件系统,旨在为云原生环境提供高性能、高可靠且与POSIX标准兼容的共享文件存储解决方案。其核心...
Read MoreSnowflake Labs近日推出开源项目pg_lake,通过将Apache Iceberg数据表格式与数据湖文件直接集成到PostgreSQL中,实现了传统关系型数据库向湖仓一体架构的演进。该项目允许用户在PostgreSQL环境中直接创建和修改Icebe...
Read MoreBasekick Labs团队在GitHub开源的高性能时序数据仓库Arc引发技术社区关注。该项目基于DuckDB列式存储引擎、Parquet文件格式和MinIO对象存储构建,在原生部署环境下实现了每秒189万条记录的写入性能,为物联网、金融...
Read More