Setting up monitoring for data freshness and completeness
Preparing for GCP Professional Data Engineer exam
Core Jobs
1. Data Quality Dimensions
Completeness — no unexpected NULLs; all required fields populated
Accuracy — values within expected ranges, valid formats
Consistency — referential integrity, no duplicates, cross-table agreement
Freshness — data arrived within expected SLA (lag monitoring)
Uniqueness — no duplicate records on primary key
2. GCP Tools for Data Quality
Tool
Use case
Dataform
SQL-based transformation + data quality tests in BigQuery
Cloud Data Quality (Cloud DQ)
Rule-based DQ checks on BigQuery tables at scale
Dataplex
Data governance, discovery, quality across data lake
Dataprep by Trifacta
Visual data cleaning and profiling (no-code/low-code)
BigQuery assertions
Inline SQL checks in queries or scheduled queries
3. Dataform Quality Tests
Use Dataform assertions to catch data quality issues:
assert_ prefix files run as data quality checks
Returns rows that FAIL the assertion (empty result = passing)
Integrate into CI/CD pipeline before promoting data to production
4. Schema Validation Patterns
Validate schema on ingestion using Dataflow side outputs
Reject malformed records to a dead-letter GCS bucket or Pub/Sub topic
Use BigQuery table schema with REQUIRED mode for mandatory fields
For JSON: validate against JSON Schema before writing
5. Data Freshness Monitoring
Cloud Monitoring custom metrics for pipeline lag
BigQuery scheduled queries to check MAX(created_at) vs current time
Dataplex data quality tasks for ongoing freshness checks
Alert via Cloud Monitoring → Pub/Sub → Cloud Functions for remediation
Key Concepts
Data Catalog — metadata management, tagging, business glossary, lineage
Dataplex — unified data governance layer over GCS + BigQuery data lakes
Dataform — version-controlled SQL transformations with built-in testing
INFORMATION_SCHEMA.TABLE_STORAGE — monitor table sizes and freshness in BigQuery
Checklist
NULL checks on required fields?
Range/format validation on critical columns?
Duplicate detection on primary key?
Dead-letter path for rejected records?
Freshness monitoring with alerting?
Schema registered in Data Catalog?
Output Format
🔴 Critical — no validation on ingested data, no dead-letter for bad records
🟡 Warning — no freshness monitoring, no schema enforcement on ingestion
🟢 Suggestion — Dataform assertions for ongoing quality, Dataplex for governance
Exam Tips
Dataform = SQL-based ELT + testing in BigQuery (like dbt for GCP)
Dataplex = governance + quality across the data lake (GCS + BigQuery)
Dead-letter pattern = invalid records → separate GCS path for human review
Data Catalog = metadata, not data quality (but integrates with Cloud DQ)
Schema validation should happen at ingestion (Dataflow) not after writing to BigQuery
1---2name: data-quality-validation3description: Data Quality Validation4---56# Data Quality Validation78## When to Use9- Designing data quality checks for a pipeline10- Schema validation after ingestion11- Setting up monitoring for data freshness and completeness12- Preparing for GCP Professional Data Engineer exam1314## Core Jobs1516### 1. Data Quality Dimensions17- **Completeness** — no unexpected NULLs; all required fields populated18- **Accuracy** — values within expected ranges, valid formats19- **Consistency** — referential integrity, no duplicates, cross-table agreement20- **Freshness** — data arrived within expected SLA (lag monitoring)21- **Uniqueness** — no duplicate records on primary key2223### 2. GCP Tools for Data Quality24| Tool | Use case |25|------|---------|26| **Dataform** | SQL-based transformation + data quality tests in BigQuery |27| **Cloud Data Quality (Cloud DQ)** | Rule-based DQ checks on BigQuery tables at scale |28| **Dataplex** | Data governance, discovery, quality across data lake |29| **Dataprep by Trifacta** | Visual data cleaning and profiling (no-code/low-code) |30| **BigQuery assertions** | Inline SQL checks in queries or scheduled queries |3132### 3. Dataform Quality Tests33Use Dataform assertions to catch data quality issues:34- `assert_` prefix files run as data quality checks35- Returns rows that FAIL the assertion (empty result = passing)36- Integrate into CI/CD pipeline before promoting data to production3738### 4. Schema Validation Patterns39- Validate schema on ingestion using Dataflow side outputs40- Reject malformed records to a dead-letter GCS bucket or Pub/Sub topic41- Use BigQuery table schema with REQUIRED mode for mandatory fields42- For JSON: validate against JSON Schema before writing4344### 5. Data Freshness Monitoring45- Cloud Monitoring custom metrics for pipeline lag46- BigQuery scheduled queries to check MAX(created_at) vs current time47- Dataplex data quality tasks for ongoing freshness checks48- Alert via Cloud Monitoring → Pub/Sub → Cloud Functions for remediation4950## Key Concepts51- **Data Catalog** — metadata management, tagging, business glossary, lineage52- **Dataplex** — unified data governance layer over GCS + BigQuery data lakes53- **Dataform** — version-controlled SQL transformations with built-in testing54- **INFORMATION_SCHEMA.TABLE_STORAGE** — monitor table sizes and freshness in BigQuery5556## Checklist57- [ ] NULL checks on required fields?58- [ ] Range/format validation on critical columns?59- [ ] Duplicate detection on primary key?60- [ ] Dead-letter path for rejected records?61- [ ] Freshness monitoring with alerting?62- [ ] Schema registered in Data Catalog?6364## Output Format65- 🔴 **Critical** — no validation on ingested data, no dead-letter for bad records66- 🟡 **Warning** — no freshness monitoring, no schema enforcement on ingestion67- 🟢 **Suggestion** — Dataform assertions for ongoing quality, Dataplex for governance6869## Exam Tips70- **Dataform** = SQL-based ELT + testing in BigQuery (like dbt for GCP)71- **Dataplex** = governance + quality across the data lake (GCS + BigQuery)72- Dead-letter pattern = invalid records → separate GCS path for human review73- Data Catalog = metadata, not data quality (but integrates with Cloud DQ)74- Schema validation should happen at ingestion (Dataflow) not after writing to BigQuery
Run npx skillmds@latest add kienbui1995/data-quality-validation in your terminal (requires Node.js), paste this page's agent-chat prompt into Claude, Cursor, or any MCP-connected agent, or download the SKILL.md file and copy it into your agent's skills directory.
Data Quality Validation It is listed under DevOps & Infra on SkillMD.
This skill has not completed SkillMD's automated safety review yet. SkillMD never runs a skill's scripts for you; review the SKILL.md before installing.
This skill is tagged as working with Claude Code, Claude.ai, OpenAI Codex. SKILL.md is an open format, so most agents that read a skills directory can load it too.
Yes. Installing skills from SkillMD is free, and the skill stays under its author's original license.
kienbui1995 (@kienbui1995) published this skill. Their other Agent Skills are listed on their SkillMD profile.