</>
Skip to content
Data Science lessons (10/42)

Data Science — Statistics

Descriptive statistics

import numpy as np
import pandas as pd

data = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]

print(f"Mean: {np.mean(data)}")
print(f"Median: {np.median(data)}")
print(f"Mode: {pd.Series(data).mode()[0]}")
print(f"Std: {np.std(data)}")
print(f"Variance: {np.var(data)}")

Distribution

from scipy import stats

# Normal distribution
x = np.linspace(-4, 4, 100)
y = stats.norm.pdf(x)

# Skewness
print(f"Skewness: {stats.skew(data)}")

# Kurtosis
print(f"Kurtosis: {stats.kurtosis(data)}")

Percentiles

print(f"25th percentile: {np.percentile(data, 25)}")
print(f"50th percentile: {np.percentile(data, 50)}")
print(f"75th percentile: {np.percentile(data, 75)}")

Correlation

import pandas as pd

df = pd.DataFrame({'x': [1,2,3,4,5], 'y': [2,4,5,4,5]})
corr = df.corr()
print(f"Correlation:\n{corr}")

Mini Practice

  1. Calculate descriptive statistics
  2. Analyze distributions
  3. Compute correlations
  4. Identify outliers

Up Next

Continue with Probability - Probability theory.

Related Topics

Frequently Asked Questions about Statistics

What is Statistics in Data Science?

Statistics is a fundamental concept in Data Science. This lesson explains it step by step with clear examples, making it easy for beginners to understand.

How do I learn Statistics?

Start by reading the explanation above, then try the code examples. Practice by modifying the examples and experimenting with different values. Hands-on practice is the best way to learn Statistics.

Why is Statistics important in Data Science?

Statistics is essential for Data Science development. Understanding this concept will help you write better code and solve real-world problems more effectively.