Complete Study Guide, Definitions and Key Concepts
What is Data Science?
Data Science: The interdisciplinary field that uses scientific methods, processes, algorithms, and systems
to extract knowledge and insights from structured and unstructured data.
Components of Data Science:
Statistics & Mathematics: Foundation for analysis and modeling
Computer Science: Programming and computational thinking
Domain Expertise: Understanding the business or research context
Data Engineering: Managing and processing large datasets
The Data Science Pipeline
1. Data Collection
Data Collection: The process of gathering raw information from various sources
Primary Data: Collected directly (surveys, experiments, sensors)
Secondary Data: Existing datasets (databases, APIs, web scraping)
Data Sources: Structured databases, unstructured text, images, videos, IoT sensors
2. Data Cleaning and Preprocessing
Data Cleaning: Identifying and correcting errors, inconsistencies, and missing values
Missing Data Handling:
Deletion (listwise, pairwise)
Imputation (mean, median, mode, advanced methods)
Prediction-based imputation
Outlier Detection: Statistical methods, visualization, domain knowledge
Data Transformation: Normalization, standardization, encoding categorical variables
3. Exploratory Data Analysis (EDA)
EDA: The critical process of analyzing datasets to summarize main characteristics using visual and
statistical methods
, Descriptive Statistics: Mean, median, mode, standard deviation, quartiles
Data Visualization: Histograms, scatter plots, box plots, correlation matrices
Pattern Recognition: Identifying trends, seasonality, correlations
4. Feature Engineering
Feature Engineering: The process of selecting, modifying, or creating new variables to improve model
performance
Feature Selection: Choosing most relevant variables
Feature Creation: Polynomial features, interaction terms, domain-specific features
Dimensionality Reduction: PCA, t-SNE, feature importance ranking
Machine Learning Fundamentals
Types of Machine Learning
1. Supervised Learning
Supervised Learning: Algorithms learn from labeled training data to make predictions on new data
Classification: Predicting categories or classes
Binary Classification (2 classes)
Multi-class Classification (3+ classes)
Examples: Email spam detection, image recognition
Regression: Predicting continuous numerical values
Linear regression, polynomial regression
Examples: House price prediction, sales forecasting
2. Unsupervised Learning
Unsupervised Learning: Finding hidden patterns in data without labeled examples
Clustering: Grouping similar data points
K-means, hierarchical clustering, DBSCAN
Examples: Customer segmentation, gene sequencing
Association Rules: Finding relationships between variables
Market basket analysis ("people who buy X also buy Y")
Dimensionality Reduction: Reducing number of features while preserving information
3. Reinforcement Learning