分布式系统

Ceph 深度实战:从 CRUSH 确定性放置、RADOS 一致性到 BlueStore 元数据栈的工程全解

本文深入拆解 Ceph 分布式存储的三大核心机制:CRUSH 确定性伪随机放置算法(straw2 加权抽签与扩容迁移量最优原理)、RADOS 主从复制与 pg_log/epoch 版本控制的一致性模型,以及 BlueStore 绕过本地文件系统、以 RocksDB + BlueFS 承载元数据的裸设备存储架构,并给出 PG 数量规划、故障域设计、scrub 限速与 block.db 容量规划等生产实战清单。

Ray 分布式计算引擎深度实战:从 Plasma 共享内存对象存储、Actor 所有权模型到 GCS 与分布式调度的工程全解

深入解析 Ray 分布式计算引擎三大基石:基于 Arrow 与共享内存的 Plasma 对象存储、所有权模型下的分布式引用计数与血缘重建容错、刻意保持轻薄的 GCS 控制面,以及自下而上的分布式调度与 Placement Group 资源预留。配合可运行代码与生产踩坑清单。

Trino 分布式 MPP 查询引擎深度实战:从 Connector 分片下推、动态过滤到分布式 Join 与容错执行的工程全解

深入剖析 Trino 分布式 MPP 查询引擎:从 Connector 三层 SPI 与 Split 分片下推、列式 Page/Block 字典编码、Broadcast 与 Partitioned Join 的代价模型取舍,到动态过滤(Dynamic Filtering)的运行时谓词反推机制,以及 Fault-Tolerant Execution 的 Exchange Materialization 与内存池化调优,给出生产环境的工程判断。

Raft 共识算法深度工程实战:从 Leader 选举到日志复制与集群成员变更的完整链路

系统解析 Raft 共识算法三大核心机制:Leader 选举的多数决与活锁避免、日志复制的流水线与 nextIndex 回退优化、安全性的 leader 完整性与提交规则。涵盖 Joint Consensus 成员变更、快照压缩、Pre-Vote 防扰乱、Leadership Transfer 优雅切换,以及 etcd/raft、raft-rs 等主流实现的性能基准对比与选型建议。

Apache Flink 状态后端与 Checkpoint 深度实战:从 Chandy-Lamport 分布式快照到 RocksDB 增量检查点

深入剖析 Flink 有状态流计算的容错内核:StateBackend 与 CheckpointStorage 拆分、Keyed State 与 TTL 语义、Chandy-Lamport barrier 对齐算法、Unaligned Checkpoint 反压降级、RocksDB 增量 checkpoint 的 SST 引用计数,以及 TwoPhaseCommitSink 的端到端精确一次落地与生产调优清单。