Exploratory Data Analysis Report
Generated automatically by myeda v0.1.0
Total Rows
1015
Samples
Total Columns
7
Features
Memory Usage
145.74 KB
RAM Allocated
Missing Cells
2.84%
202 total missing
Duplicate Rows
1.48%
15 duplicates
⚠️ Data Quality Alerts
4 Issues Detected
Missing Values
Salary
Column 'Salary' has 121 missing values (11.92%).
Constant Column
Constant_Feature
Column 'Constant_Feature' has zero variance (constant single value across all rows).
Duplicate Rows
Dataset Level
Dataset contains 15 duplicate rows (1.48%).
High Skewness
Salary
Numerical column 'Salary' has a skewed distribution (skewness = 12.2372).
💡 Actionable Recommendations
| Target / Column | Category | Issue Context | Recommended Action |
|---|---|---|---|
| Salary | Imputation | 11.92% missing values & skewed distribution (skew=12.2372). | Use Median Imputation (`df['col'].fillna(df['col'].median())`) to avoid outlier distortion. |
| Age | Imputation | 4.93% missing values with symmetric distribution. | Use Mean Imputation (`df['col'].fillna(df['col'].mean())`) or KNN Imputer. |
| Education | Imputation | 3.05% missing values in categorical feature. | Use Mode Imputation or introduce a distinct `'Missing'` category tag. |
| Salary | Transformation | Right-skewed feature distribution (skew = 12.2372). | Apply Log Transformation (`np.log1p(df['col'])`) to normalize distribution. |
| Salary | Outliers | 49 outliers (5.48%) detected via IQR method. | Apply Winsorization or Quantile Clipping between -69319.9242 and 153360.3019. |
| Constant_Feature | Feature Drop | Constant column with single value. | Drop column `Constant_Feature` as it carries zero variance and no predictive signal. |
📌 Missing Values Analysis
| Column Name | Missing Count | Missing % | Visual Distribution |
|---|---|---|---|
| Salary | 121 | 11.92% | █░░░░░░░░░ |
| Age | 50 | 4.93% | ░░░░░░░░░░ |
| Education | 31 | 3.05% | ░░░░░░░░░░ |
| Experience | 0 | 0.0% | ░░░░░░░░░░ |
| Department | 0 | 0.0% | ░░░░░░░░░░ |
| Is_Promoted | 0 | 0.0% | ░░░░░░░░░░ |
| Constant_Feature | 0 | 0.0% | ░░░░░░░░░░ |
📊 Numerical Features Statistics
| Column | Mean | Std Dev | Median | Min | Max | Skewness | Kurtosis |
|---|---|---|---|---|---|---|---|
| Age | 35.4023 | 11.7693 | 35.5572 | -3.8952 | 81.2328 | 0.1052 | 0.0626 |
| Salary | 58044.8429 | 128611.5624 | 36201.6484 | 161.1727 | 2100000.0 | 12.2372 | 176.0623 |
| Experience | 9.4729 | 5.7857 | 9.0 | 0.0 | 19.0 | 0.0075 | -1.2303 |
| Constant_Feature | 100.0 | 0.0 | 100.0 | 100.0 | 100.0 | 0.0 | 0.0 |
Feature Distribution Plots
🏷️ Categorical Features Statistics
| Column | Unique Values | Most Frequent Value | Mode Count | Mode % |
|---|---|---|---|---|
| Department | 5 | HR |
213 | 20.99% |
| Education | 4 | Master |
253 | 24.93% |
Categorical Frequency Charts
🔗 Feature Correlation Matrix
🎯 Outlier Analysis
| Column | IQR Outliers Count | IQR Outliers % | IQR Bounds [Lower, Upper] | Z-Score Outliers Count (>3σ) |
|---|---|---|---|---|
| Salary | 49 | 5.48% | [-69319.9242, 153360.3019] |
4 |
| Age | 8 | 0.83% | [4.7984, 65.7268] |
3 |
| Experience | 0 | 0.0% | [-12.5, 31.5] |
0 |
| Constant_Feature | 0 | 0.0% | [100.0, 100.0] |
0 |
🤖 Machine Learning Insights
Inferred ML Task: Binary Classification
Target 'Is_Promoted' has 2 unique values; identified as Binary Classification.
PCA Variance Analysis
Top 2 PCA components explain 67.81% of overall variance.