Chapter-1. Introduction to Data Science.............................9
1.1 Introduction to data science
1.2 Concept of big data –
1.2.1 Definition
1.2.2 Data types with example (Structured, Semi-Structured, Unstructured Data)
1.2.3 Challenges with unstructured data
1.2.4 Data Sources (Open Data, Social Media Data, Multimodal Data, standard datasets)
1.2.5 Data Formats (Integers, Floats, Text Data, Text Files, Dense Numerical Arrays, Compressed or Archived Data, CSV Files, JSON Files, XML Files, HTML Files, Tar Files, GZip Files, Zip Files, Image Files
1.2.6 3 V’s of bigdata (Volume, Velocity, Variety)give
1.3 Application of Data Science
1.4 Data Science Lifecycle
1.5 Role of Data Scientist
1.6 Data Scientist’s Toolbox(Programming Languages, Libraries, Database, Visualization tools)
Chapter-2. Data Understanding and Preprocessing.........67
2.1 Concepts of data –
2.1.1 Definition
2.1.2 Types of Data (Qualitative (categorical) – Nominal, Ordinal and Quantitative (numerical) – Discrete, Continuous)
2.1.3 Outlier – Types of outlier with example
2.2 Data Pre-processing –
2.2.1 Definition
2.2.2 Need to pre-process the data
2.2.3 Data quality
2.2.4 Measures of Data Quality (Accuracy, Completeness,
Consistency, Timeliness, Validity, and Uniqueness)
Chapter-3. Data Pre-processing Techniques....................85
3.1 Data Pre-processing techniques
3.1.1 Data Cleaning – Missing Value, Noisy Data, Inconsistent Data
3.1.2 Data Integration - Problems in data integration
3.1.3 Data Transformation – Strategies of data transformation (Rescaling, Normalizing, Binarizing, Standardizing, Label and One Hot Encoding)
3.2 Data Reduction -
3.2.1 Dimensionality Reduction
3.2.2 Feature Selection
3.2.3 Feature Extraction
3.2.4 Data Cube Aggregation
3.2.5 Numerosity Reduction
3.3 Data Discretization –
3.3.1 Approaches of data Discretization (Top-down, Bottom-up)
3.3.2 Types of Data Discretization techniques (Equal Width Binning,
Equal Frequency Binning)
3.5 Introduction to Exploratory Data Analysis(EDA)
Chapter-4. Data Visualization...........................................136
4.1 Introduction
4.2 Advantages of data Visualization
4.3 Advantages and visual encoding
4.4 Data visualization libraries
4.5 Data visualization tools - Histograms, Bar charts/graphs, Scatter plots, Line charts, Area plots, Pie charts, Donut charts, Boxplots, Bubble plots, Heat map, Dendrogram, Venn diagram, Treemap, 3D scatter plots
4.5 Advanced data visualization tools- Wordclouds, Visualization of geospatial data
Chapter-5. Introduction to Data Analytics.........................185
5.1 Introduction
5.2 Life Cycle of Data Analytics
5.3 Types of data analytics – Descriptive Analytics, Diagnostic Analytics, Predictive Analytics, Prescriptive Analytics
5.4 Mathematical models –
Introduction, Need of mathematical models in Data Analytics
5.5 Model evaluation – Metrics for evaluating classifiers – Accuracy, Confusion matrix, Precision, Recall and F1 Score, ROC(Receiver-Operator Characteristic), AUC (Area Under ROC Curve), Mean Squared Error (MSE), Cross Validation, Log-loss
Chapter-6. Introduction to Machine Learning.................223
6.1 Introduction to Machine Learning, Deep Learning, Artificial intelligence
6.2 Applications for machine learning in data science
6.3 Modelling process, Engineering features and selecting a model
6.4 Training the model
6.5 Validating the model
6.6 Predicting new observations
6.7 Types of machine learning- Supervised learning, Unsupervised learning, Semi-supervised learning, Reinforcement Learning
6.8 Machine learning models –
6.8.1 Supervised Learning Model – Regression (Linear Regression, Polynomial Regression, Logistic Regression), Classification (KNN, Random Forest)
6.8.2 Unsupervised Learning Models – Clustering (K-means clustering), Association (Apriori Algorithm)