大数据

Apache Calcite 查询编译框架与 Hive 执行引擎深度工程实战:从 SqlNode 校验、Volcano/Cascades 规划器、RelTrait 与 Convention 传播、物化视图改写、Rex 表达式化简到 Hive Tez DAG 与向量化执行的全链路解析

拆解现代 SQL 引擎的公共骨架:Calcite 的四阶段流水线、RelNode/RexNode 二分建模、Volcano 与 Hep 两套规划器的分工、Trait/Convention 如何支撑跨引擎物理实现、SubstitutionVisitor 与 UnifyRule 的物化视图改写机制,以及 Hive 如何把 RelNode 落到 Tez DAG、VectorizedRowBatch 与 LLAP,并给出生产调优清单。

OpenZFS 存储栈深度工程实战:从 SPA/DMU/DSL 四层架构、COW 与 TXG 事务组、ZIL/SLOG 同步写、RAID-Z 可变条带到 ARC 自适应替换缓存的全链路解析

拆解 ZFS 落盘的每一层结构:SPA/DMU/DSL/ZPL 四层分工、128 字节 blkptr 间接块树如何支撑 COW、TXG 三态机把随机写聚合为顺序写、ZIL 与 SLOG 拯救同步写延迟、RAID-Z 可变条带的容量税、ARC 为什么不是 LRU(MRU/MFU + ghost 链表),并给出生产环境可照抄的调优清单与去重/BRT 的取舍判断。

Apache HBase 读写路径深度工程实战:从 WAL 与 MemStore 跳表、HFile 块格式与布隆过滤、BlockCache 分层到 Region 分裂与 Compaction 策略的全链路解析

拆解 HBase 读写全链路:WAL 追加与 MVCC read point、MemStore 跳表与 MSLAB Chunk 池化对抗 GC、HFile 块布局与 Bloom+索引+块内二分的三级跳过、KeyValueHeap k 路归并读路径、L1/L2 分层 BlockCache、Region 分裂的延迟物化引用文件,以及 Compaction 文件选择策略与生产故障排查清单。

Apache MapReduce Shuffle 引擎深度工程实战:从 MapOutputBuffer 环形缓冲、Spill 索引排序到 Reduce 端拉流归并的全链路解析

拆解 MapReduce Shuffle 全链路:MapOutputBuffer 四数组环形缓冲与只排索引不排数据的排序技巧、spill 数据文件与 IndexRecord 索引文件的 O(1) 定位、ShuffleHandler 从 Jetty 迁 Netty 的动因、Reduce 端 MapHost 的 PENDING/BUSY/PENALIZED 状态机与慢启动、k 路归并与 final merge 流式接口,并给出生产故障排查清单与调优参数矩阵。

Apache YARN 资源调度深度工程实战:从 RMApp/RMContainer 状态机、层级队列与 DRF 到心跳拉取式分配、抢占与生产故障全链路

拆解 YARN 调度内核的四层设计:RMApp/RMAppAttempt/RMContainer 三层状态机与事件驱动、层级队列与 DRF 主导资源公平的二维公平性计算、NM 心跳拉取式分配为何能撑到万级节点、Container 本地化与抢占信号语义,并给出六类生产故障模式的排查清单。

Apache HDFS 存储引擎深度工程实战:从 NameNode 元数据内存模型、EditLog/FsImage、租约与块报告到写入管线恢复与短路读全链路

拆解 HDFS 的四个工程内核:NameNode 全内存 INode 树与 BlocksMap 为何不落盘、EditLog/FsImage 双文件持久化与 QJM 多数派 fencing、写路径的租约与管线三阶段恢复、读路径的短路读与块报告最终一致性,并给出七类生产故障排查清单。

Apache Hudi 深度工程实战:从 Timeline MVCC、记录级索引到 MOR/COW 的湖仓 Upsert 引擎全解

拆解 Apache Hudi 的三层工程内核:Timeline 时间线 MVCC 的快照与增量语义、File Group/File Slice 的物理布局、记录级索引(Bloom/Bucket/Record Index)的代价模型;对比 COW 与 MOR 的取舍边界,给出 Compaction/Clustering/Cleaner 表服务节奏、OCC 多写入端冲突治理与七个生产踩坑清单。