Teradata Data Profiling and Quality Analytics
| Skill Name |
Teradata Data Profiling and Quality Analytics |
| Description |
Comprehensive data profiling and quality assessment using Teradata ClearScape Analytics descriptive statistics functions |
| Category |
Data Quality & Profiling |
| Functions |
TD_UnivariateStatistics, TD_Frequency, TD_Histogram, TD_ColumnSummary, TD_Correlation |
Core Capabilities
- Complete data profiling workflow from basic statistics to advanced quality metrics
- Automated descriptive statistics using Teradata ClearScape Analytics functions
- Comprehensive data quality assessment with actionable insights
- Column-level profiling for both numeric and categorical variables
- Distribution analysis including quartiles, percentiles, skewness, and kurtosis
- Missing value detection and completeness metrics
- Outlier identification using statistical methods (IQR, Z-score)
- Correlation analysis for numeric features
- Frequency distributions for categorical variables
- Data type validation and consistency checks
- Business-ready reports with quality scores and recommendations
Data Profiling Workflow
This skill automatically analyzes your provided table to generate comprehensive data profiling reports using Teradata's descriptive statistics functions.
1. Table Discovery and Metadata Analysis
- Schema Detection: Automatically retrieves table structure and column definitions
- Data Type Classification: Identifies numeric, categorical, date/time, and text columns
- Column Count and Names: Catalogs all available columns for profiling
- Table Size Assessment: Determines row count and storage characteristics
- Primary Key Detection: Identifies unique identifiers and key columns
2. Univariate Statistics (Numeric Columns)
Using TD_UnivariateStatistics and native SQL functions:
- Central Tendency: Mean, Median, Mode
- Dispersion: Standard Deviation, Variance, Range, IQR
- Distribution Shape: Skewness, Kurtosis
- Position Measures: Minimum, Maximum, Quartiles (Q1, Q2, Q3)
- Percentiles: 1st, 5th, 10th, 25th, 50th, 75th, 90th, 95th, 99th
- Count Statistics: Total count, Non-null count, Null count, Distinct count
- Coefficient of Variation: Relative variability measure
3. Categorical Variable Profiling
Using TD_Frequency and aggregation functions:
- Cardinality: Count of unique/distinct values
- Frequency Distribution: Value counts and percentages
- Mode Detection: Most common values (Top 10)
- Rare Value Detection: Values with frequency < 1%
- Missing Values: Null count and percentage
- Entropy Calculation: Measure of information content
- Category Balance: Distribution uniformity assessment
4. Distribution Analysis
Using TD_Histogram and statistical functions:
- Histogram Generation: Bin-based distribution visualization data
- Distribution Type Detection: Normal, Skewed, Bimodal, Uniform
- Normality Assessment: Statistical tests and indicators
- Outlier Detection: IQR method, Z-score method, Modified Z-score
- Density Estimation: Value concentration patterns
5. Data Quality Metrics
- Completeness: Percentage of non-null values per column
- Uniqueness: Distinct value ratio and duplicate detection
- Validity: Data type conformance and range validation
- Consistency: Pattern matching and format validation
- Accuracy Indicators: Statistical anomaly detection
- Quality Score: Overall column quality rating (0-100)
6. Correlation Analysis (Numeric Columns)
Using TD_Correlation and correlation functions:
- Pearson Correlation: Linear relationship strength
- Correlation Matrix: All numeric column pairs
- Highly Correlated Pairs: |correlation| > 0.7
- Multicollinearity Detection: VIF (Variance Inflation Factor) indicators
7. Missing Value Analysis
- Column-level Missing Patterns: Per-column null statistics
- Missing Value Heatmap Data: Row-wise missing patterns
- Completeness Score: Overall data completeness percentage
- Missing Value Recommendations: Imputation strategy suggestions
8. Outlier Detection and Analysis
- IQR Method: Q1 - 1.5IQR and Q3 + 1.5IQR boundaries
- Z-Score Method: Values beyond ±3 standard deviations
- Modified Z-Score: Median-based robust outlier detection
- Outlier Count and Percentage: Per-column outlier statistics
- Outlier Impact Assessment: Influence on mean and standard deviation
How to Use This Skill
Provide Your Table Information:
"Profile table: database_name.table_name"
or
"Analyze data quality for: my_customer_data"
or
"Generate comprehensive profiling report for: sales_database.transactions_table"
The Skill Will:
- Automatically detect all columns and their data types
- Execute comprehensive profiling across all applicable columns
- Generate descriptive statistics using Teradata ClearScape Analytics functions
- Produce data quality scores and recommendations
- Create detailed profiling reports with actionable insights
Example Requests:
"Profile my table: retail_db.customer_transactions"
"Generate data quality report for: analytics.sales_data"
"Analyze the data distribution in: warehouse.product_inventory"
"Check data quality and completeness for: marketing.customer_profiles"
Skill Instructions for Table Profiling
When a user provides a table name, follow this comprehensive workflow:
Step 1: Table Discovery
-- Get table metadata and structure
SHOW COLUMNS FROM {user_database}.{user_table};
-- Get table statistics
SELECT
DatabaseName,
TableName,
CreateTimeStamp,
LastAlterTimeStamp
FROM DBC.TablesV
WHERE DatabaseName = '{user_database}'
AND TableName = '{user_table}';
-- Get row count and basic metrics
SELECT COUNT(*) as total_rows
FROM {user_database}.{user_table};
Step 2: Column Classification
Automatically classify columns into:
- Numeric Columns: INTEGER, BIGINT, DECIMAL, FLOAT, NUMBER types
- Categorical Columns: CHAR, VARCHAR with moderate cardinality (< 50 distinct values)
- Date/Time Columns: DATE, TIMESTAMP, TIME types
- Text Columns: VARCHAR, CLOB with high cardinality (free text)
- Boolean Columns: Binary or Yes/No type fields
Step 3: Execute Profiling Workflow
Run comprehensive profiling scripts in sequence:
- basic_profiling.sql - Row counts, column counts, basic metrics
- numeric_profiling.sql - Univariate statistics for all numeric columns
- categorical_profiling.sql - Frequency analysis for categorical columns
- distribution_analysis.sql - Histogram and distribution characteristics
- quality_assessment.sql - Missing values, outliers, consistency checks
- correlation_analysis.sql - Correlation matrix for numeric columns
- comprehensive_report.sql - Consolidated profiling report
Step 4: Generate Quality Report
Produce a comprehensive report including:
- Executive Summary: High-level data quality scores
- Column Profiles: Detailed statistics per column
- Data Quality Issues: Identified problems and recommendations
- Distribution Insights: Statistical characteristics of data
- Correlation Insights: Relationships between variables
- Action Items: Prioritized data quality improvements
Input Requirements
Data Requirements
- Source table: Any Teradata table with data to profile
- Column variety: Support for numeric, categorical, date, and text columns
- Minimum sample size: At least 10 rows for meaningful statistics (100+ recommended)
- Table access: READ permission on the target table
Technical Requirements
- Teradata Vantage with ClearScape Analytics enabled
- Database permissions: SELECT on target database/table
- Function access: TD_UnivariateStatistics, TD_Frequency, TD_Histogram, TD_ColumnSummary, TD_Correlation
- Temporary table space: For intermediate profiling results
Output Formats
Generated Reports
- Comprehensive Profiling Report: Multi-section detailed analysis
- Data Quality Dashboard Data: Metrics suitable for visualization
- Column-Level Statistics: Individual column profiles
- Distribution Visualizations: Histogram data and box plot statistics
- Correlation Matrices: Numeric column relationships
- Quality Score Cards: Overall and per-column quality ratings
Profiling Tables Created
- {table_name}_profile_numeric: Numeric column statistics
- {table_name}_profile_categorical: Categorical column frequencies
- {table_name}_profile_quality: Data quality metrics
- {table_name}_profile_outliers: Identified outlier records
- {table_name}_profile_correlation: Correlation matrix
- {table_name}_profile_summary: Executive summary report
SQL Scripts Generated
- Complete profiling workflow customized for your table structure
- Parameterized queries using actual column names from your table
- Ready-to-execute SQL with proper error handling
- Cleanup procedures for temporary objects
Data Profiling Use Cases Supported
- Initial Data Discovery: Understanding new datasets before analysis
- Data Quality Assessment: Identifying issues before ETL or modeling
- Data Migration Validation: Comparing source and target data characteristics
- Ongoing Data Monitoring: Tracking data quality over time
- Feature Engineering Guidance: Identifying transformation needs for ML
- Reporting and Documentation: Generating data dictionaries and profiles
- Compliance and Auditing: Documenting data characteristics for regulations
- Data Cleansing Planning: Prioritizing data quality improvement efforts
Descriptive Statistics Functions Used
TD_UnivariateStatistics
- Comprehensive univariate analysis for numeric columns
- Generates mean, median, mode, std dev, variance, quartiles
- Calculates skewness and kurtosis for distribution shape
- Provides count statistics including nulls and distinct values
TD_Frequency
- Frequency distribution analysis for categorical variables
- Identifies most common and rare values
- Calculates value percentages and cumulative frequencies
- Supports grouped frequency analysis
TD_Histogram
- Creates histogram bins for numeric distributions
- Configurable bin count and width
- Generates frequency counts per bin
- Supports equal-width and equal-frequency binning
TD_ColumnSummary
- Quick summary statistics across multiple columns
- Identifies data types and null percentages
- Calculates basic statistics (min, max, mean)
- Provides overview of table characteristics
TD_Correlation
- Pearson correlation coefficient calculation
- Correlation matrix generation for multiple columns
- Identifies linear relationships between variables
- Supports partial correlation analysis
Best Practices Applied
- Comprehensive Coverage: Profile all relevant columns automatically
- Performance Optimization: Efficient queries for large datasets
- Statistical Rigor: Use industry-standard statistical methods
- Actionable Insights: Provide recommendations, not just numbers
- Business Context: Interpret statistics in business terms
- Quality Scoring: Quantify data quality for tracking and comparison
- Documentation: Clear explanations of all metrics and findings
- Scalability: Handle tables from small to very large efficiently
- Error Handling: Graceful handling of edge cases and data issues
- Reproducibility: Consistent results for repeated profiling
Example Usage
-- Example: Comprehensive Data Profiling Workflow
-- Replace 'your_table' with actual table name
-- 1. Initial table discovery
SELECT COUNT(*) as row_count,
COUNT(DISTINCT customer_id) as unique_customers
FROM your_database.your_table;
-- 2. Numeric column profiling using TD_UnivariateStatistics
SELECT * FROM TD_UnivariateStatistics(
ON your_database.your_table
USING
TargetColumns('age', 'income', 'purchase_amount', 'credit_score')
) AS dt;
-- 3. Categorical column profiling using TD_Frequency
SELECT * FROM TD_Frequency(
ON your_database.your_table
USING
TargetColumns('customer_segment', 'region', 'product_category')
TopK(10)
) AS dt;
-- 4. Distribution analysis using TD_Histogram
SELECT * FROM TD_Histogram(
ON your_database.your_table
USING
TargetColumn('purchase_amount')
NumBins(20)
) AS dt;
-- 5. Correlation analysis using TD_Correlation
SELECT * FROM TD_Correlation(
ON your_database.your_table
USING
TargetColumns('age', 'income', 'purchase_amount', 'credit_score')
) AS dt;
-- (Detailed SQL provided by the skill)
Scripts Included
Core Profiling Scripts
basic_profiling.sql: Table-level statistics and row counts
numeric_profiling.sql: TD_UnivariateStatistics for numeric columns
categorical_profiling.sql: TD_Frequency analysis for categorical columns
distribution_analysis.sql: TD_Histogram and distribution metrics
quality_assessment.sql: Missing values, duplicates, validity checks
correlation_analysis.sql: TD_Correlation matrix for numeric features
outlier_detection.sql: Multiple outlier detection methods
comprehensive_report.sql: Consolidated profiling report generation
Utility Scripts
table_discovery.sql: Metadata extraction and column classification
data_quality_scoring.sql: Quality score calculation algorithms
profiling_summary.sql: Executive summary generation
cleanup.sql: Remove temporary profiling tables
Advanced Analytics Scripts
time_series_profiling.sql: Temporal data profiling for date columns
text_profiling.sql: Text column analysis (length, patterns, uniqueness)
pattern_detection.sql: Data pattern and format analysis
comparison_profiling.sql: Compare profiles across tables or time periods
Quality Metrics Defined
Completeness Score (0-100)
- 100: No missing values in any column
- 90-99: < 10% missing values
- 70-89: 10-30% missing values
- < 70: > 30% missing values (requires attention)
Uniqueness Score (0-100)
- Based on distinct value ratio
- 100: All values unique (potential key column)
- 50-99: Good variety
- < 50: Low variety or many duplicates
Validity Score (0-100)
- Data type conformance
- Range validation (within expected bounds)
- Format consistency
- Business rule compliance
Overall Quality Score (0-100)
- Weighted average of Completeness, Uniqueness, and Validity
- 90-100: Excellent quality
- 70-89: Good quality, minor issues
- 50-69: Fair quality, attention needed
- < 50: Poor quality, significant issues
Profiling Report Structure
1. Executive Summary
- Total rows and columns
- Overall quality score
- Critical issues count
- Profiling timestamp
2. Numeric Column Profiles
Per column:
- Basic statistics (mean, median, std dev)
- Distribution characteristics
- Outlier count and percentage
- Missing value percentage
- Quality score
3. Categorical Column Profiles
Per column:
- Unique value count (cardinality)
- Top 10 most frequent values
- Rare value count (< 1% frequency)
- Missing value percentage
- Quality score
4. Data Quality Issues
- Missing value patterns
- Duplicate records
- Outliers by column
- Invalid values
- Consistency violations
5. Distribution Insights
- Distribution types identified
- Skewness and kurtosis interpretation
- Normality assessment
- Transformation recommendations
6. Correlation Insights
- Highly correlated pairs (|r| > 0.7)
- Potential multicollinearity
- Feature redundancy detection
- Relationship strength matrix
7. Recommendations
- Data cleansing priorities
- Feature engineering suggestions
- Data quality improvement actions
- Monitoring recommendations
Limitations and Disclaimers
- Sample Size: Very small tables (< 10 rows) may produce unreliable statistics
- Performance: Large tables (> 100M rows) may require sampling for efficiency
- Data Types: Binary large objects (BLOBs) and complex types have limited profiling
- Domain Knowledge: Statistical findings require business context for proper interpretation
- Dynamic Data: Profiles are point-in-time snapshots; data may change
- Function Availability: Requires ClearScape Analytics functions to be enabled
- Computational Resources: Complex profiling may consume significant resources
Quality Checks and Validations
Automated Validations
- Table Existence: Verify table exists before profiling
- Column Access: Confirm SELECT permissions on all columns
- Function Availability: Check TD_ functions are accessible
- Data Type Support: Validate columns are profilable
- Sample Size: Ensure sufficient data for statistics
Manual Review Points
- Business Rule Validation: Verify metrics align with domain expectations
- Outlier Legitimacy: Confirm outliers are errors vs. valid extreme values
- Missing Value Causes: Understand why data is missing (systemic vs. random)
- Distribution Interpretation: Contextualize statistical findings
- Quality Threshold Setting: Define acceptable quality levels per use case
Updates and Maintenance
- Version Compatibility: Tested with Teradata Vantage 17.x and above
- ClearScape Analytics: Optimized for latest ClearScape Analytics features
- Performance Tuning: Regular query optimization for large-scale profiling
- Best Practices: Updated with industry standards and community feedback
- Documentation: Enhanced with real-world profiling examples and case studies
- Function Updates: Aligned with new Teradata descriptive statistics capabilities
Integration with Analytics Workflows
This profiling skill integrates seamlessly with:
- Data Preparation: Inform cleaning and transformation strategies
- Feature Engineering: Guide feature creation and selection
- Model Training: Validate data before ML modeling (preprocessing for decision trees, regression, etc.)
- Model Evaluation: Compare training vs. production data distributions
- Data Monitoring: Track data quality degradation over time
- Compliance Reporting: Generate documentation for data governance
This skill provides production-ready comprehensive data profiling and quality assessment using Teradata ClearScape Analytics with industry-leading statistical rigor and business-focused insights.
1---2name: td-data-profiling3description: Comprehensive data profiling and quality assessment using Teradata ClearScape Analytics descriptive statistics functions4---5
6# Teradata Data Profiling and Quality Analytics
7
8| **Skill Name** | Teradata Data Profiling and Quality Analytics |
9|----------------|--------------|
10| **Description** | Comprehensive data profiling and quality assessment using Teradata ClearScape Analytics descriptive statistics functions |
11| **Category** | Data Quality & Profiling |
12| **Functions** | TD_UnivariateStatistics, TD_Frequency, TD_Histogram, TD_ColumnSummary, TD_Correlation |
13
14## Core Capabilities
15
16- **Complete data profiling workflow** from basic statistics to advanced quality metrics
17- **Automated descriptive statistics** using Teradata ClearScape Analytics functions
18- **Comprehensive data quality assessment** with actionable insights
19- **Column-level profiling** for both numeric and categorical variables
20- **Distribution analysis** including quartiles, percentiles, skewness, and kurtosis
21- **Missing value detection** and completeness metrics
22- **Outlier identification** using statistical methods (IQR, Z-score)
23- **Correlation analysis** for numeric features
24- **Frequency distributions** for categorical variables
25- **Data type validation** and consistency checks
26- **Business-ready reports** with quality scores and recommendations
27
28## Data Profiling Workflow
29
30This skill automatically analyzes your provided table to generate comprehensive data profiling reports using Teradata's descriptive statistics functions.
31
32### 1. Table Discovery and Metadata Analysis
33- **Schema Detection**: Automatically retrieves table structure and column definitions
34- **Data Type Classification**: Identifies numeric, categorical, date/time, and text columns
35- **Column Count and Names**: Catalogs all available columns for profiling
36- **Table Size Assessment**: Determines row count and storage characteristics
37- **Primary Key Detection**: Identifies unique identifiers and key columns
38
39### 2. Univariate Statistics (Numeric Columns)
40Using **TD_UnivariateStatistics** and native SQL functions:
41- **Central Tendency**: Mean, Median, Mode
42- **Dispersion**: Standard Deviation, Variance, Range, IQR
43- **Distribution Shape**: Skewness, Kurtosis
44- **Position Measures**: Minimum, Maximum, Quartiles (Q1, Q2, Q3)
45- **Percentiles**: 1st, 5th, 10th, 25th, 50th, 75th, 90th, 95th, 99th
46- **Count Statistics**: Total count, Non-null count, Null count, Distinct count
47- **Coefficient of Variation**: Relative variability measure
48
49### 3. Categorical Variable Profiling
50Using **TD_Frequency** and aggregation functions:
51- **Cardinality**: Count of unique/distinct values
52- **Frequency Distribution**: Value counts and percentages
53- **Mode Detection**: Most common values (Top 10)
54- **Rare Value Detection**: Values with frequency < 1%
55- **Missing Values**: Null count and percentage
56- **Entropy Calculation**: Measure of information content
57- **Category Balance**: Distribution uniformity assessment
58
59### 4. Distribution Analysis
60Using **TD_Histogram** and statistical functions:
61- **Histogram Generation**: Bin-based distribution visualization data
62- **Distribution Type Detection**: Normal, Skewed, Bimodal, Uniform
63- **Normality Assessment**: Statistical tests and indicators
64- **Outlier Detection**: IQR method, Z-score method, Modified Z-score
65- **Density Estimation**: Value concentration patterns
66
67### 5. Data Quality Metrics
68- **Completeness**: Percentage of non-null values per column
69- **Uniqueness**: Distinct value ratio and duplicate detection
70- **Validity**: Data type conformance and range validation
71- **Consistency**: Pattern matching and format validation
72- **Accuracy Indicators**: Statistical anomaly detection
73- **Quality Score**: Overall column quality rating (0-100)
74
75### 6. Correlation Analysis (Numeric Columns)
76Using **TD_Correlation** and correlation functions:
77- **Pearson Correlation**: Linear relationship strength
78- **Correlation Matrix**: All numeric column pairs
79- **Highly Correlated Pairs**: |correlation| > 0.7
80- **Multicollinearity Detection**: VIF (Variance Inflation Factor) indicators
81
82### 7. Missing Value Analysis
83- **Column-level Missing Patterns**: Per-column null statistics
84- **Missing Value Heatmap Data**: Row-wise missing patterns
85- **Completeness Score**: Overall data completeness percentage
86- **Missing Value Recommendations**: Imputation strategy suggestions
87
88### 8. Outlier Detection and Analysis
89- **IQR Method**: Q1 - 1.5*IQR and Q3 + 1.5*IQR boundaries
90- **Z-Score Method**: Values beyond ±3 standard deviations
91- **Modified Z-Score**: Median-based robust outlier detection
92- **Outlier Count and Percentage**: Per-column outlier statistics
93- **Outlier Impact Assessment**: Influence on mean and standard deviation
94
95## How to Use This Skill
96
971. **Provide Your Table Information**:
98 ```
99 "Profile table: database_name.table_name"
100 or
101 "Analyze data quality for: my_customer_data"
102 or
103 "Generate comprehensive profiling report for: sales_database.transactions_table"
104 ```
105
1062. **The Skill Will**:
107 - Automatically detect all columns and their data types
108 - Execute comprehensive profiling across all applicable columns
109 - Generate descriptive statistics using Teradata ClearScape Analytics functions
110 - Produce data quality scores and recommendations
111 - Create detailed profiling reports with actionable insights
112
1133. **Example Requests**:
114 ```
115 "Profile my table: retail_db.customer_transactions"
116 "Generate data quality report for: analytics.sales_data"
117 "Analyze the data distribution in: warehouse.product_inventory"
118 "Check data quality and completeness for: marketing.customer_profiles"
119 ```
120
121## Skill Instructions for Table Profiling
122
123When a user provides a table name, follow this comprehensive workflow:
124
125### Step 1: Table Discovery
126```sql
127-- Get table metadata and structure
128SHOW COLUMNS FROM {user_database}.{user_table};
129
130-- Get table statistics
131SELECT
132 DatabaseName,
133 TableName,
134 CreateTimeStamp,
135 LastAlterTimeStamp
136FROM DBC.TablesV
137WHERE DatabaseName = '{user_database}'
138 AND TableName = '{user_table}';
139
140-- Get row count and basic metrics
141SELECT COUNT(*) as total_rows
142FROM {user_database}.{user_table};
143```
144
145### Step 2: Column Classification
146Automatically classify columns into:
147- **Numeric Columns**: INTEGER, BIGINT, DECIMAL, FLOAT, NUMBER types
148- **Categorical Columns**: CHAR, VARCHAR with moderate cardinality (< 50 distinct values)
149- **Date/Time Columns**: DATE, TIMESTAMP, TIME types
150- **Text Columns**: VARCHAR, CLOB with high cardinality (free text)
151- **Boolean Columns**: Binary or Yes/No type fields
152
153### Step 3: Execute Profiling Workflow
154Run comprehensive profiling scripts in sequence:
1551. **basic_profiling.sql** - Row counts, column counts, basic metrics
1562. **numeric_profiling.sql** - Univariate statistics for all numeric columns
1573. **categorical_profiling.sql** - Frequency analysis for categorical columns
1584. **distribution_analysis.sql** - Histogram and distribution characteristics
1595. **quality_assessment.sql** - Missing values, outliers, consistency checks
1606. **correlation_analysis.sql** - Correlation matrix for numeric columns
1617. **comprehensive_report.sql** - Consolidated profiling report
162
163### Step 4: Generate Quality Report
164Produce a comprehensive report including:
165- **Executive Summary**: High-level data quality scores
166- **Column Profiles**: Detailed statistics per column
167- **Data Quality Issues**: Identified problems and recommendations
168- **Distribution Insights**: Statistical characteristics of data
169- **Correlation Insights**: Relationships between variables
170- **Action Items**: Prioritized data quality improvements
171
172## Input Requirements
173
174### Data Requirements
175- **Source table**: Any Teradata table with data to profile
176- **Column variety**: Support for numeric, categorical, date, and text columns
177- **Minimum sample size**: At least 10 rows for meaningful statistics (100+ recommended)
178- **Table access**: READ permission on the target table
179
180### Technical Requirements
181- **Teradata Vantage** with ClearScape Analytics enabled
182- **Database permissions**: SELECT on target database/table
183- **Function access**: TD_UnivariateStatistics, TD_Frequency, TD_Histogram, TD_ColumnSummary, TD_Correlation
184- **Temporary table space**: For intermediate profiling results
185
186## Output Formats
187
188### Generated Reports
189- **Comprehensive Profiling Report**: Multi-section detailed analysis
190- **Data Quality Dashboard Data**: Metrics suitable for visualization
191- **Column-Level Statistics**: Individual column profiles
192- **Distribution Visualizations**: Histogram data and box plot statistics
193- **Correlation Matrices**: Numeric column relationships
194- **Quality Score Cards**: Overall and per-column quality ratings
195
196### Profiling Tables Created
197- **{table_name}_profile_numeric**: Numeric column statistics
198- **{table_name}_profile_categorical**: Categorical column frequencies
199- **{table_name}_profile_quality**: Data quality metrics
200- **{table_name}_profile_outliers**: Identified outlier records
201- **{table_name}_profile_correlation**: Correlation matrix
202- **{table_name}_profile_summary**: Executive summary report
203
204### SQL Scripts Generated
205- **Complete profiling workflow** customized for your table structure
206- **Parameterized queries** using actual column names from your table
207- **Ready-to-execute SQL** with proper error handling
208- **Cleanup procedures** for temporary objects
209
210## Data Profiling Use Cases Supported
211
2121. **Initial Data Discovery**: Understanding new datasets before analysis
2132. **Data Quality Assessment**: Identifying issues before ETL or modeling
2143. **Data Migration Validation**: Comparing source and target data characteristics
2154. **Ongoing Data Monitoring**: Tracking data quality over time
2165. **Feature Engineering Guidance**: Identifying transformation needs for ML
2176. **Reporting and Documentation**: Generating data dictionaries and profiles
2187. **Compliance and Auditing**: Documenting data characteristics for regulations
2198. **Data Cleansing Planning**: Prioritizing data quality improvement efforts
220
221## Descriptive Statistics Functions Used
222
223### TD_UnivariateStatistics
224- Comprehensive univariate analysis for numeric columns
225- Generates mean, median, mode, std dev, variance, quartiles
226- Calculates skewness and kurtosis for distribution shape
227- Provides count statistics including nulls and distinct values
228
229### TD_Frequency
230- Frequency distribution analysis for categorical variables
231- Identifies most common and rare values
232- Calculates value percentages and cumulative frequencies
233- Supports grouped frequency analysis
234
235### TD_Histogram
236- Creates histogram bins for numeric distributions
237- Configurable bin count and width
238- Generates frequency counts per bin
239- Supports equal-width and equal-frequency binning
240
241### TD_ColumnSummary
242- Quick summary statistics across multiple columns
243- Identifies data types and null percentages
244- Calculates basic statistics (min, max, mean)
245- Provides overview of table characteristics
246
247### TD_Correlation
248- Pearson correlation coefficient calculation
249- Correlation matrix generation for multiple columns
250- Identifies linear relationships between variables
251- Supports partial correlation analysis
252
253## Best Practices Applied
254
255- **Comprehensive Coverage**: Profile all relevant columns automatically
256- **Performance Optimization**: Efficient queries for large datasets
257- **Statistical Rigor**: Use industry-standard statistical methods
258- **Actionable Insights**: Provide recommendations, not just numbers
259- **Business Context**: Interpret statistics in business terms
260- **Quality Scoring**: Quantify data quality for tracking and comparison
261- **Documentation**: Clear explanations of all metrics and findings
262- **Scalability**: Handle tables from small to very large efficiently
263- **Error Handling**: Graceful handling of edge cases and data issues
264- **Reproducibility**: Consistent results for repeated profiling
265
266## Example Usage
267
268```sql
269-- Example: Comprehensive Data Profiling Workflow
270-- Replace 'your_table' with actual table name
271
272-- 1. Initial table discovery
273SELECT COUNT(*) as row_count,
274 COUNT(DISTINCT customer_id) as unique_customers
275FROM your_database.your_table;
276
277-- 2. Numeric column profiling using TD_UnivariateStatistics
278SELECT * FROM TD_UnivariateStatistics(
279 ON your_database.your_table
280 USING
281 TargetColumns('age', 'income', 'purchase_amount', 'credit_score')
282) AS dt;
283
284-- 3. Categorical column profiling using TD_Frequency
285SELECT * FROM TD_Frequency(
286 ON your_database.your_table
287 USING
288 TargetColumns('customer_segment', 'region', 'product_category')
289 TopK(10)
290) AS dt;
291
292-- 4. Distribution analysis using TD_Histogram
293SELECT * FROM TD_Histogram(
294 ON your_database.your_table
295 USING
296 TargetColumn('purchase_amount')
297 NumBins(20)
298) AS dt;
299
300-- 5. Correlation analysis using TD_Correlation
301SELECT * FROM TD_Correlation(
302 ON your_database.your_table
303 USING
304 TargetColumns('age', 'income', 'purchase_amount', 'credit_score')
305) AS dt;
306
307-- (Detailed SQL provided by the skill)
308```
309
310## Scripts Included
311
312### Core Profiling Scripts
313- **`basic_profiling.sql`**: Table-level statistics and row counts
314- **`numeric_profiling.sql`**: TD_UnivariateStatistics for numeric columns
315- **`categorical_profiling.sql`**: TD_Frequency analysis for categorical columns
316- **`distribution_analysis.sql`**: TD_Histogram and distribution metrics
317- **`quality_assessment.sql`**: Missing values, duplicates, validity checks
318- **`correlation_analysis.sql`**: TD_Correlation matrix for numeric features
319- **`outlier_detection.sql`**: Multiple outlier detection methods
320- **`comprehensive_report.sql`**: Consolidated profiling report generation
321
322### Utility Scripts
323- **`table_discovery.sql`**: Metadata extraction and column classification
324- **`data_quality_scoring.sql`**: Quality score calculation algorithms
325- **`profiling_summary.sql`**: Executive summary generation
326- **`cleanup.sql`**: Remove temporary profiling tables
327
328### Advanced Analytics Scripts
329- **`time_series_profiling.sql`**: Temporal data profiling for date columns
330- **`text_profiling.sql`**: Text column analysis (length, patterns, uniqueness)
331- **`pattern_detection.sql`**: Data pattern and format analysis
332- **`comparison_profiling.sql`**: Compare profiles across tables or time periods
333
334## Quality Metrics Defined
335
336### Completeness Score (0-100)
337- 100: No missing values in any column
338- 90-99: < 10% missing values
339- 70-89: 10-30% missing values
340- < 70: > 30% missing values (requires attention)
341
342### Uniqueness Score (0-100)
343- Based on distinct value ratio
344- 100: All values unique (potential key column)
345- 50-99: Good variety
346- < 50: Low variety or many duplicates
347
348### Validity Score (0-100)
349- Data type conformance
350- Range validation (within expected bounds)
351- Format consistency
352- Business rule compliance
353
354### Overall Quality Score (0-100)
355- Weighted average of Completeness, Uniqueness, and Validity
356- 90-100: Excellent quality
357- 70-89: Good quality, minor issues
358- 50-69: Fair quality, attention needed
359- < 50: Poor quality, significant issues
360
361## Profiling Report Structure
362
363### 1. Executive Summary
364- Total rows and columns
365- Overall quality score
366- Critical issues count
367- Profiling timestamp
368
369### 2. Numeric Column Profiles
370Per column:
371- Basic statistics (mean, median, std dev)
372- Distribution characteristics
373- Outlier count and percentage
374- Missing value percentage
375- Quality score
376
377### 3. Categorical Column Profiles
378Per column:
379- Unique value count (cardinality)
380- Top 10 most frequent values
381- Rare value count (< 1% frequency)
382- Missing value percentage
383- Quality score
384
385### 4. Data Quality Issues
386- Missing value patterns
387- Duplicate records
388- Outliers by column
389- Invalid values
390- Consistency violations
391
392### 5. Distribution Insights
393- Distribution types identified
394- Skewness and kurtosis interpretation
395- Normality assessment
396- Transformation recommendations
397
398### 6. Correlation Insights
399- Highly correlated pairs (|r| > 0.7)
400- Potential multicollinearity
401- Feature redundancy detection
402- Relationship strength matrix
403
404### 7. Recommendations
405- Data cleansing priorities
406- Feature engineering suggestions
407- Data quality improvement actions
408- Monitoring recommendations
409
410## Limitations and Disclaimers
411
412- **Sample Size**: Very small tables (< 10 rows) may produce unreliable statistics
413- **Performance**: Large tables (> 100M rows) may require sampling for efficiency
414- **Data Types**: Binary large objects (BLOBs) and complex types have limited profiling
415- **Domain Knowledge**: Statistical findings require business context for proper interpretation
416- **Dynamic Data**: Profiles are point-in-time snapshots; data may change
417- **Function Availability**: Requires ClearScape Analytics functions to be enabled
418- **Computational Resources**: Complex profiling may consume significant resources
419
420## Quality Checks and Validations
421
422### Automated Validations
423- **Table Existence**: Verify table exists before profiling
424- **Column Access**: Confirm SELECT permissions on all columns
425- **Function Availability**: Check TD_ functions are accessible
426- **Data Type Support**: Validate columns are profilable
427- **Sample Size**: Ensure sufficient data for statistics
428
429### Manual Review Points
430- **Business Rule Validation**: Verify metrics align with domain expectations
431- **Outlier Legitimacy**: Confirm outliers are errors vs. valid extreme values
432- **Missing Value Causes**: Understand why data is missing (systemic vs. random)
433- **Distribution Interpretation**: Contextualize statistical findings
434- **Quality Threshold Setting**: Define acceptable quality levels per use case
435
436## Updates and Maintenance
437
438- **Version Compatibility**: Tested with Teradata Vantage 17.x and above
439- **ClearScape Analytics**: Optimized for latest ClearScape Analytics features
440- **Performance Tuning**: Regular query optimization for large-scale profiling
441- **Best Practices**: Updated with industry standards and community feedback
442- **Documentation**: Enhanced with real-world profiling examples and case studies
443- **Function Updates**: Aligned with new Teradata descriptive statistics capabilities
444
445## Integration with Analytics Workflows
446
447This profiling skill integrates seamlessly with:
448- **Data Preparation**: Inform cleaning and transformation strategies
449- **Feature Engineering**: Guide feature creation and selection
450- **Model Training**: Validate data before ML modeling (preprocessing for decision trees, regression, etc.)
451- **Model Evaluation**: Compare training vs. production data distributions
452- **Data Monitoring**: Track data quality degradation over time
453- **Compliance Reporting**: Generate documentation for data governance
454
455---
456
457*This skill provides production-ready comprehensive data profiling and quality assessment using Teradata ClearScape Analytics with industry-leading statistical rigor and business-focused insights.*