数据湖仓

Trino 分布式 MPP 查询引擎深度实战:从 Connector 分片下推、动态过滤到分布式 Join 与容错执行的工程全解

深入剖析 Trino 分布式 MPP 查询引擎:从 Connector 三层 SPI 与 Split 分片下推、列式 Page/Block 字典编码、Broadcast 与 Partitioned Join 的代价模型取舍,到动态过滤(Dynamic Filtering)的运行时谓词反推机制,以及 Fault-Tolerant Execution 的 Exchange Materialization 与内存池化调优,给出生产环境的工程判断。

Apache Calcite 查询编译框架与 Hive 执行引擎深度工程实战:从 SqlNode 校验、Volcano/Cascades 规划器、RelTrait 与 Convention 传播、物化视图改写、Rex 表达式化简到 Hive Tez DAG 与向量化执行的全链路解析

拆解现代 SQL 引擎的公共骨架:Calcite 的四阶段流水线、RelNode/RexNode 二分建模、Volcano 与 Hep 两套规划器的分工、Trait/Convention 如何支撑跨引擎物理实现、SubstitutionVisitor 与 UnifyRule 的物化视图改写机制,以及 Hive 如何把 RelNode 落到 Tez DAG、VectorizedRowBatch 与 LLAP,并给出生产调优清单。