Lakehouse 不是新名詞,而是儲存、表格式、運算各自演進之後自然收斂的架構。Hare 把它做成一個可以直接落地的平臺。
每一代都是為了解決上一代的結構性限制而出現。捲動看看它們怎麼一步步走到 Lakehouse。
產業層級的硬體與標準變化,不屬於任何一家廠商——所以所有平臺都往同一個方向走。
1 GbE → 25 / 100 GbE,硬碟 → NVMe。遠端讀資料不再是瓶頸,「運算必須貼著資料」的前提消失,儲存與運算終於可以分開。
S3 API 成為儲存層的共同語言,地端與雲端一致、所有工具都支援。資料放哪裡,應用程式都不用改。
在開放資料檔之上補一層可靠的元資料,讓資料湖第一次具備資料倉儲等級的交易與治理能力。
| 能力 | 資料倉儲 | 資料湖 | Hare Lakehouse |
|---|---|---|---|
| 結構化 + 半結構化 + 非結構化 | ✕ | ✓ | ✓ |
| ACID 交易與一致性 | ✓ | ✕ | ✓ |
| 版本回溯(Time Travel) | △ | ✕ | ✓ |
| 儲存與運算獨立擴充 | △ | ✕ | ✓ |
| 多引擎共用同一份資料 | ✕ | △ | ✓ |
| 開放格式、不綁廠商 | ✕ | ✓ | ✓ |
| 欄 / 列級權限與稽核 | ✓ | △ | ✓ |
| 直接供應 AI / ML 讀取 | △ | ✓ | ✓ |
每次寫入都產生一個新快照,舊快照保留。按左邊的按鈕操作資料,再點上方任一個快照「回到過去」。
新增欄位不重寫任何資料檔——舊資料直接顯示 null。
Hare 的表格式層以 Apache Iceberg 實作。
Hare 為每個資料檔記錄欄位的最大/最小值。查詢時,和條件無關的檔案直接跳過。點選不同的查詢條件看看。
Hare 站在這些方向的延長線上——每一項新能力出來,都是直接接上,不是重新建置。
表目錄介面收斂成共同標準,換引擎、加引擎的成本越來越低。
事件資料直接寫進開放表,省掉中間的 ETL 批次,資料更即時。
物件儲存直接供應模型訓練,向量檢索與分析共用同一個平臺。
SQL、Spark、串流、Python 共用同一份表,不再為每種工具複製資料。
從現況盤點開始,給您一份具體的目標架構。