Iceberg、Hudi 还是 Delta Lake
回答六个关于写入模式、查询引擎、平台归属和运维投入的问题,得到一份加权推荐 —— 以及每一分是哪个回答加上去的。判断依据全部写在页面里,不接受就改自己的权重。
选项按你的实际情况选,右侧结果会实时更新。
为什么是加权打分,而不是流程图
网上大多数「三格式对比」最后都收在一张流程图上,而第一个分叉往往是「你用 Databricks 吗」—— 那不是决策辅助,那是漏斗。真实项目里同时有四五个因素在拉扯:写入模式、主力引擎、 已有平台、数据新鲜度、团队能投入多少运维,以及对锁定的容忍度。它们的方向常常不一致, 所以这里用加权求和,并且把每一项的理由摊开给你看。
权重集中在三处真实差异上。记录级 upsert 与 CDC 是 Hudi 的强项 —— MOR 表加索引,写放大最低,增量查询是一等公民。引擎中立与目录选择 是 Iceberg 的强项 —— Trino、Athena、Flink 全是一等支持,REST catalog 规范让你能换引擎;云厂商的托管路径也基本默认 Iceberg。 平台重力 是 Delta 的强项 —— 已经在 Databricks 上时, Unity Catalog、Photon、DLT 都围绕 Delta 构建,换格式等于主动放弃平台能力。
有两点这个工具不会替你决定:格式互操作(Iceberg 与 Delta 之间的转换、Unity Catalog 对 Iceberg 的支持) 在快速变化,值得在选型前重新确认一遍;以及迁移成本 —— 已经有几百张表在跑的时候, 「更合适的格式」通常赢不了「已经在用的格式」。