Dashboard Overview

Summary metrics and dataset health audit

Total Rows
1015
Sample Observations
Total Columns
7
Features
Missing Cells
2.84%
202 missing entries
Duplicates
1.48%
15 duplicate rows
Numeric Features
Quantitative variables
Categorical Features
Qualitative variables
Memory Usage
145.74 KB
Allocated RAM
Quality Score
79.5 / 100
Overall Dataset Health

Dataset Overview

Data structure, memory requirements, and target definition

Property Details
Dataset Shape1015 Rows × 7 Columns
Memory Footprint145.74 KB
Total Data Points cells
Target ColumnIs_Promoted
Data Types Breakdown Numeric, Categorical

Variables Analysis

Per-feature metrics, distribution charts, and summary statistics

Age Numeric
Missing 4.93% (50)
Unique 950
Mean 35.4023
Median 35.5572
Std Dev 11.7693
Outliers 8
Salary Numeric
Missing 11.92% (121)
Unique 881
Mean 58044.8429
Median 36201.6484
Std Dev 128611.5624
Outliers 49
Experience Numeric
Missing 0.0% (0)
Unique 20
Mean 9.4729
Median 9.0
Std Dev 5.7857
Outliers 0
Department Categorical
Missing 0.0% (0)
Unique 5
Top Mode HR (213)
Education Categorical
Missing 3.05% (31)
Unique 4
Top Mode Master (253)
Is_Promoted Boolean
Missing 0.0% (0)
Unique 2
Top Mode - (0)
Constant_Feature Numeric
Missing 0.0% (0)
Unique 1
Mean 100.0
Median 100.0
Std Dev 0.0
Outliers 0

Missing Values Analysis

Missingness distributions, percentages, and imputation needs

Column Name Missing Count Missing Percentage Status
Salary 121 11.92% Moderate
Age 50 4.93% Moderate
Education 31 3.05% Moderate
Experience 0 0.0% Complete
Department 0 0.0% Complete
Is_Promoted 0 0.0% Complete
Constant_Feature 0 0.0% Complete

Duplicate & Redundancy Analysis

Row-level duplicates, zero-variance columns, and constant features

Duplicate Rows
15
1.48% of total dataset
Constant Columns
1
Zero variance features

Constant Columns Detected

These features contain only a single unique value across all rows:

  • Constant_Feature

Correlation Analysis

Inter-feature correlation heatmaps and multicollinearity audits

Feature Distributions

Histograms, box plots, and value frequency distributions

Numerical Feature Distributions

Categorical Frequency Distributions

Outlier Analysis

Interquartile Range (IQR) and Z-score anomaly detection

Column IQR Outlier Count IQR Outlier % IQR Bounds [Lower, Upper] Z-Score Outliers (>3σ)
Salary 49 5.48% [-69319.9242, 153360.3019] 4
Age 8 0.83% [4.7984, 65.7268] 3
Experience 0 0.0% [-12.5, 31.5] 0
Constant_Feature 0 0.0% [100.0, 100.0] 0

Target Analysis & Feature Importance

Target class balance, feature correlations, and Machine Learning insights

Target Variable
Is_Promoted
Detected Task
Binary Classification

Actionable Preprocessing Recommendations

Automated recommendations engine suggestions

Salary

11.92% missing values & skewed distribution (skew=12.2372).

Use Median Imputation (`df['col'].fillna(df['col'].median())`) to avoid outlier distortion.
Age

4.93% missing values with symmetric distribution.

Use Mean Imputation (`df['col'].fillna(df['col'].mean())`) or KNN Imputer.
Education

3.05% missing values in categorical feature.

Use Mode Imputation or introduce a distinct `'Missing'` category tag.
Salary

Right-skewed feature distribution (skew = 12.2372).

Apply Log Transformation (`np.log1p(df['col'])`) to normalize distribution.
Salary

49 outliers (5.48%) detected via IQR method.

Apply Winsorization or Quantile Clipping between -69319.9242 and 153360.3019.
Constant_Feature

Constant column with single value.

Drop column `Constant_Feature` as it carries zero variance and no predictive signal.