Data Lake Platform
Build and operate production data lakes and lakehouses: ingest, transform, store in open formats, and serve analytics reliably.
When to Use
- Design data lake/lakehouse architecture
- Set up ingestion pipelines (batch, incremental, CDC)
- Build SQL transformation layers (SQLMesh, dbt)
- Choose table formats and catalogs (Iceberg, Delta, Hudi)
- Deploy query/serving engines (Trino, ClickHouse, DuckDB)
- Implement streaming pipelines (Kafka, Flink)
- Set up orchestration (Dagster, Airflow, Prefect)
- Add governance, lineage, data quality, and cost controls
Triage Questions
- Batch, streaming, or hybrid? What is the freshness SLO?
- Append-only vs upserts/deletes (CDC)? Is time travel required?
- Primary query pattern: BI dashboards (high concurrency), ad-hoc joins, embedded analytics?
- PII/compliance: row/column-level access, retention, audit logging?
- Platform constraints: self-hosted vs cloud, preferred engines, team strengths?
Default Baseline (Good Starting Point)
- Storage: object storage + open table format (usually Iceberg)
- Catalog: REST/Hive/Glue/Nessie/Unity (match your platform)
- Transforms: SQLMesh or dbt (pick one and standardize)
- Lake query: Trino (or Spark for heavy compute/ML workloads)
- Serving (optional): ClickHouse/StarRocks/Doris for low-latency BI
- Governance: DataHub/OpenMetadata + OpenLineage
- Orchestration: Dagster/Airflow/Prefect
Workflow
- Pick table format + catalog:
references/storage-formats.md (use assets/cross-platform/template-schema-evolution.md and assets/cross-platform/template-partitioning-strategy.md)
- Design ingestion (batch/incremental/CDC):
references/ingestion-patterns.md (use assets/cross-platform/template-ingestion-governance-checklist.md and assets/cross-platform/template-incremental-loading.md)
- Design transformations (bronze/silver/gold or data products):
references/transformation-patterns.md (use assets/cross-platform/template-data-pipeline.md)
- Choose lake query vs serving engines:
references/query-engine-patterns.md
- Add governance, lineage, and quality gates:
references/governance-catalog.md (use assets/cross-platform/template-data-quality-governance.md and assets/cross-platform/template-data-quality.md)
- Plan operations + cost controls:
references/operational-playbook.md and references/cost-optimization.md (use assets/cross-platform/template-data-quality-backfill-runbook.md and assets/cross-platform/template-cost-optimization.md)
Architecture Patterns
- Medallion (bronze/silver/gold):
references/architecture-patterns.md
- Data mesh (domain-owned data products):
references/architecture-patterns.md
- Streaming-first (Kappa):
references/streaming-patterns.md
- Diagrams/mermaid snippets:
references/overview.md
Quick Start
dlt + ClickHouse
pip install "dlt[clickhouse]"
dlt init rest_api clickhouse
python pipeline.py
SQLMesh + DuckDB
pip install sqlmesh
sqlmesh init duckdb
sqlmesh plan && sqlmesh run
Reliability and Safety
Do
- Define data contracts and owners up front
- Add quality gates (freshness, volume, schema, distribution) per tier
- Make every pipeline idempotent and re-runnable (backfills are normal)
- Treat access control and audit logging as first-class requirements
Avoid
- Skipping validation to "move fast"
- Storing PII without access controls
- Pipelines that can't be re-run safely
- Manual schema changes without version control
Resources
| Resource |
Purpose |
| references/overview.md |
Diagrams and decision flows |
| references/architecture-patterns.md |
Medallion, data mesh |
| references/ingestion-patterns.md |
dlt vs Airbyte, CDC |
| references/transformation-patterns.md |
SQLMesh vs dbt |
| references/storage-formats.md |
Iceberg vs Delta |
| references/query-engine-patterns.md |
ClickHouse, DuckDB |
| references/streaming-patterns.md |
Kafka, Flink |
| references/orchestration-patterns.md |
Dagster, Airflow |
| references/bi-visualization-patterns.md |
Metabase, Superset |
| references/cost-optimization.md |
Cost levers and maintenance |
| references/operational-playbook.md |
Monitoring and incident response |
| references/governance-catalog.md |
Catalog, lineage, access control |
Templates
| Template |
Purpose |
| assets/cross-platform/template-medallion-architecture.md |
Baseline bronze/silver/gold plan |
| assets/cross-platform/template-data-pipeline.md |
End-to-end pipeline skeleton |
| assets/cross-platform/template-ingestion-governance-checklist.md |
Source onboarding checklist |
| assets/cross-platform/template-incremental-loading.md |
Incremental + backfill plan |
| assets/cross-platform/template-schema-evolution.md |
Schema change rules |
| assets/cross-platform/template-cost-optimization.md |
Cost control checklist |
| assets/cross-platform/template-data-quality-governance.md |
Quality contracts + SLOs |
| assets/cross-platform/template-data-quality-backfill-runbook.md |
Backfill incident/runbook |
Related Skills
1---2name: data-lake-platform3description: Data lake and lakehouse platform patterns: ingestion/CDC, transformations, open table formats (Iceberg/Delta/Hudi), query and serving engines (Trino/ClickHouse/DuckDB), orchestration, governance/lineage, cost and operations. Self-hosted and cloud options.4---5
6# Data Lake Platform
7
8Build and operate production data lakes and lakehouses: ingest, transform, store in open formats, and serve analytics reliably.
9
10## When to Use
11
12- Design data lake/lakehouse architecture
13- Set up ingestion pipelines (batch, incremental, CDC)
14- Build SQL transformation layers (SQLMesh, dbt)
15- Choose table formats and catalogs (Iceberg, Delta, Hudi)
16- Deploy query/serving engines (Trino, ClickHouse, DuckDB)
17- Implement streaming pipelines (Kafka, Flink)
18- Set up orchestration (Dagster, Airflow, Prefect)
19- Add governance, lineage, data quality, and cost controls
20
21## Triage Questions
22
231. Batch, streaming, or hybrid? What is the freshness SLO?
242. Append-only vs upserts/deletes (CDC)? Is time travel required?
253. Primary query pattern: BI dashboards (high concurrency), ad-hoc joins, embedded analytics?
264. PII/compliance: row/column-level access, retention, audit logging?
275. Platform constraints: self-hosted vs cloud, preferred engines, team strengths?
28
29## Default Baseline (Good Starting Point)
30
31- Storage: object storage + open table format (usually Iceberg)
32- Catalog: REST/Hive/Glue/Nessie/Unity (match your platform)
33- Transforms: SQLMesh or dbt (pick one and standardize)
34- Lake query: Trino (or Spark for heavy compute/ML workloads)
35- Serving (optional): ClickHouse/StarRocks/Doris for low-latency BI
36- Governance: DataHub/OpenMetadata + OpenLineage
37- Orchestration: Dagster/Airflow/Prefect
38
39## Workflow
40
411. Pick table format + catalog: `references/storage-formats.md` (use `assets/cross-platform/template-schema-evolution.md` and `assets/cross-platform/template-partitioning-strategy.md`)
422. Design ingestion (batch/incremental/CDC): `references/ingestion-patterns.md` (use `assets/cross-platform/template-ingestion-governance-checklist.md` and `assets/cross-platform/template-incremental-loading.md`)
433. Design transformations (bronze/silver/gold or data products): `references/transformation-patterns.md` (use `assets/cross-platform/template-data-pipeline.md`)
444. Choose lake query vs serving engines: `references/query-engine-patterns.md`
455. Add governance, lineage, and quality gates: `references/governance-catalog.md` (use `assets/cross-platform/template-data-quality-governance.md` and `assets/cross-platform/template-data-quality.md`)
466. Plan operations + cost controls: `references/operational-playbook.md` and `references/cost-optimization.md` (use `assets/cross-platform/template-data-quality-backfill-runbook.md` and `assets/cross-platform/template-cost-optimization.md`)
47
48## Architecture Patterns
49
50- Medallion (bronze/silver/gold): `references/architecture-patterns.md`
51- Data mesh (domain-owned data products): `references/architecture-patterns.md`
52- Streaming-first (Kappa): `references/streaming-patterns.md`
53- Diagrams/mermaid snippets: `references/overview.md`
54
55## Quick Start
56
57### dlt + ClickHouse
58
59```bash
60pip install "dlt[clickhouse]"
61dlt init rest_api clickhouse
62python pipeline.py
63```
64
65### SQLMesh + DuckDB
66
67```bash
68pip install sqlmesh
69sqlmesh init duckdb
70sqlmesh plan && sqlmesh run
71```
72
73## Reliability and Safety
74
75### Do
76
77- Define data contracts and owners up front
78- Add quality gates (freshness, volume, schema, distribution) per tier
79- Make every pipeline idempotent and re-runnable (backfills are normal)
80- Treat access control and audit logging as first-class requirements
81
82### Avoid
83
84- Skipping validation to "move fast"
85- Storing PII without access controls
86- Pipelines that can't be re-run safely
87- Manual schema changes without version control
88
89## Resources
90
91| Resource | Purpose |
92|----------|---------|
93| [references/overview.md](references/overview.md) | Diagrams and decision flows |
94| [references/architecture-patterns.md](references/architecture-patterns.md) | Medallion, data mesh |
95| [references/ingestion-patterns.md](references/ingestion-patterns.md) | dlt vs Airbyte, CDC |
96| [references/transformation-patterns.md](references/transformation-patterns.md) | SQLMesh vs dbt |
97| [references/storage-formats.md](references/storage-formats.md) | Iceberg vs Delta |
98| [references/query-engine-patterns.md](references/query-engine-patterns.md) | ClickHouse, DuckDB |
99| [references/streaming-patterns.md](references/streaming-patterns.md) | Kafka, Flink |
100| [references/orchestration-patterns.md](references/orchestration-patterns.md) | Dagster, Airflow |
101| [references/bi-visualization-patterns.md](references/bi-visualization-patterns.md) | Metabase, Superset |
102| [references/cost-optimization.md](references/cost-optimization.md) | Cost levers and maintenance |
103| [references/operational-playbook.md](references/operational-playbook.md) | Monitoring and incident response |
104| [references/governance-catalog.md](references/governance-catalog.md) | Catalog, lineage, access control |
105
106## Templates
107
108| Template | Purpose |
109|----------|---------|
110| [assets/cross-platform/template-medallion-architecture.md](assets/cross-platform/template-medallion-architecture.md) | Baseline bronze/silver/gold plan |
111| [assets/cross-platform/template-data-pipeline.md](assets/cross-platform/template-data-pipeline.md) | End-to-end pipeline skeleton |
112| [assets/cross-platform/template-ingestion-governance-checklist.md](assets/cross-platform/template-ingestion-governance-checklist.md) | Source onboarding checklist |
113| [assets/cross-platform/template-incremental-loading.md](assets/cross-platform/template-incremental-loading.md) | Incremental + backfill plan |
114| [assets/cross-platform/template-schema-evolution.md](assets/cross-platform/template-schema-evolution.md) | Schema change rules |
115| [assets/cross-platform/template-cost-optimization.md](assets/cross-platform/template-cost-optimization.md) | Cost control checklist |
116| [assets/cross-platform/template-data-quality-governance.md](assets/cross-platform/template-data-quality-governance.md) | Quality contracts + SLOs |
117| [assets/cross-platform/template-data-quality-backfill-runbook.md](assets/cross-platform/template-data-quality-backfill-runbook.md) | Backfill incident/runbook |
118
119## Related Skills
120
121| Skill | Purpose |
122|-------|---------|
123| [ai-mlops](../ai-mlops/SKILL.md) | ML deployment |
124| [ai-ml-data-science](../ai-ml-data-science/SKILL.md) | Feature engineering |
125| [data-sql-optimization](../data-sql-optimization/SKILL.md) | OLTP optimization |