Data Science — Statistics
Descriptive statistics
import numpy as np
import pandas as pd
data = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]
print(f"Mean: {np.mean(data)}")
print(f"Median: {np.median(data)}")
print(f"Mode: {pd.Series(data).mode()[0]}")
print(f"Std: {np.std(data)}")
print(f"Variance: {np.var(data)}")
Distribution
from scipy import stats
# Normal distribution
x = np.linspace(-4, 4, 100)
y = stats.norm.pdf(x)
# Skewness
print(f"Skewness: {stats.skew(data)}")
# Kurtosis
print(f"Kurtosis: {stats.kurtosis(data)}")
Percentiles
print(f"25th percentile: {np.percentile(data, 25)}")
print(f"50th percentile: {np.percentile(data, 50)}")
print(f"75th percentile: {np.percentile(data, 75)}")
Correlation
import pandas as pd
df = pd.DataFrame({'x': [1,2,3,4,5], 'y': [2,4,5,4,5]})
corr = df.corr()
print(f"Correlation:\n{corr}")
Mini Practice
- Calculate descriptive statistics
- Analyze distributions
- Compute correlations
- Identify outliers
Up Next
Continue with Probability - Probability theory.
Related Topics
Frequently Asked Questions about Statistics
What is Statistics in Data Science?
Statistics is a fundamental concept in Data Science. This lesson explains it step by step with clear examples, making it easy for beginners to understand.
How do I learn Statistics?
Start by reading the explanation above, then try the code examples. Practice by modifying the examples and experimenting with different values. Hands-on practice is the best way to learn Statistics.
Why is Statistics important in Data Science?
Statistics is essential for Data Science development. Understanding this concept will help you write better code and solve real-world problems more effectively.