資料湖的彈性,
資料倉儲的可靠。

Lakehouse 不是新名詞,而是儲存、表格式、運算各自演進之後自然收斂的架構。Hare 把它做成一個可以直接落地的平臺。

架構演進

資料平臺架構的演進。

每一代都是為了解決上一代的結構性限制而出現。捲動看看它們怎麼一步步走到 Lakehouse。

2000s

資料倉儲

  • 查詢快、Schema 嚴謹
  • 交易一致、治理成熟
  • 容量與成本天花板
  • 只擅長結構化資料
2010s

資料湖

  • 普通硬體水平擴充
  • 什麼格式都裝得下
  • 儲存與運算綁在一起
  • 缺乏交易,資料易成沼澤
2020s

Lakehouse · Hare

  • 物件儲存 + 開放表格式
  • 儲算分離、各自擴充
  • ACID、版本、Schema 演進
  • 多引擎共用同一份資料
為什麼是現在

推動世代交替的關鍵。

產業層級的硬體與標準變化,不屬於任何一家廠商——所以所有平臺都往同一個方向走。

2006
2012
2018
今天

網路與儲存變快了

1 GbE → 25 / 100 GbE,硬碟 → NVMe。遠端讀資料不再是瓶頸,「運算必須貼著資料」的前提消失,儲存與運算終於可以分開。

地端機房雲端 A
S3 API
SQL 引擎AI 框架

物件儲存介面標準化

S3 API 成為儲存層的共同語言,地端與雲端一致、所有工具都支援。資料放哪裡,應用程式都不用改。

ACID 交易
版本 / Time Travel
Schema 演進
開放資料檔

開放表格式成熟

在開放資料檔之上補一層可靠的元資料,讓資料湖第一次具備資料倉儲等級的交易與治理能力。

架構比較

資料倉儲、資料湖、Lakehouse,一張表看懂。

能力資料倉儲資料湖Hare Lakehouse
結構化 + 半結構化 + 非結構化✕✓✓
ACID 交易與一致性✓✕✓
版本回溯(Time Travel)△✕✓
儲存與運算獨立擴充△✕✓
多引擎共用同一份資料✕△✓
開放格式、不綁廠商✕✓✓
欄 / 列級權限與稽核✓△✓
直接供應 AI / ML 讀取△✓✓
動手試試

Hare 怎麼讓一張表變得可靠?

每次寫入都產生一個新快照,舊快照保留。按左邊的按鈕操作資料,再點上方任一個快照「回到過去」。

新增欄位不重寫任何資料檔——舊資料直接顯示 null。

ACID 交易寫入完成才切換快照,讀的人永遠看到完整資料
Time Travel任何歷史版本都能查,誤刪誤改可回溯
Schema 演進欄位以 ID 追蹤,改表不重寫資料
開放資料檔底層仍是 Parquet,任何引擎都讀得懂

Hare 的表格式層以 Apache Iceberg 實作。

查得快的秘密

不是掃得快,是掃得少。

Hare 為每個資料檔記錄欄位的最大/最小值。查詢時,和條件無關的檔案直接跳過。點選不同的查詢條件看看。

掃描檔案 24 / 24直接跳過 0讀取資料量 0 MB
往前看

接下來幾年,確定的發展方向。

Hare 站在這些方向的延長線上——每一項新能力出來,都是直接接上,不是重新建置。

🧭

Catalog 標準化

表目錄介面收斂成共同標準,換引擎、加引擎的成本越來越低。

⚡

串流直通入湖

事件資料直接寫進開放表,省掉中間的 ETL 批次,資料更即時。

🤖

AI 工作負載融合

物件儲存直接供應模型訓練,向量檢索與分析共用同一個平臺。

🔗

一份資料,多引擎

SQL、Spark、串流、Python 共用同一份表,不再為每種工具複製資料。

想知道 Lakehouse 放進貴公司長什麼樣子?

從現況盤點開始,給您一份具體的目標架構。