Нормальное распределение и его применение
Ключевые тезисы:
- Биномиальное распределение при большом числе испытаний (
n) сходится к нормальному (Гауссову) распределению. - Нормальное распределение описывается двумя параметрами: средним значением (μ) и стандартным отклонением (σ).
- Стандартное нормальное распределение — это частный случай с μ=0 и σ=1.
- Вероятности для нормального распределения удобно вычислять через кумулятивную функцию распределения (CDF).
- Использование нормальной аппроксимации упрощает вычисление сложных вероятностей для биномиального распределения.
Связь биномиального и нормального распределений
- Биномиальное распределение моделирует количество успехов (
s) в серии независимых испытаний (например, количество орлов при 100 бросках монеты). - При достаточно большом
nи умеренных вероятностях это распределение начинает сходиться к нормальному. - Нормальное распределение (Гауссово) имеет форму колокола и характеризуется:
- μ (среднее) — центр распределения.
- σ (стандартное отклонение) или σ² (дисперсия) — мера разброса данных.
- Большое σ → широкое, пологое распределение.
- Малое σ → узкое, пикообразное распределение (значения близки к среднему).
Стандартное нормальное распределение
- Это каноническая форма с параметрами μ = 0 и σ = 1.
- Его функция плотности вероятности (PDF) симметрична относительно среднего.
- Вероятность того, что случайная величина
Xлежит в интервале[a, b], вычисляется как интеграл от PDF на этом отрезке:P(a ≤ X ≤ b) = ∫[a, b] f(x) dx - Кумулятивная функция распределения (CDF), обозначаемая Φ(x), определяется как:
Φ(x) = P(X ≤ x) = ∫[-∞, x] f(t) dt- Это вероятность того, что случайная величина примет значение, меньшее или равное
x. - CDF монотонно возрастает от 0 до 1.
- Это вероятность того, что случайная величина примет значение, меньшее или равное
Практическое вычисление вероятностей
- Раньше для расчётов использовали таблицы (глиняные таблички
) значений CDF только для стандартного нормального распределения. - Сегодня это делается одной командой в Python (например, в
scipy.stats). - Полезный факт: Для стандартного нормального распределения:
- Вероятность попасть в интервал ±1σ от среднего (т.е. между -1 и 1) составляет около 68%.
Φ(1) ≈ 0.841(вероятность того, чтоX ≤ 1).
Пример: Аппроксимация биномиального распределения
Задача: Найти вероятность выпадения от 190 до 230 орлов при 400 бросках честной монеты (p = 0.5).
Традиционный (сложный) способ:
- Случайная величина
X(число орлов) имеет биномиальное распределение:X ~ Bin(n=400, p=0.5). - Нужно просуммировать 41 вероятность:
P(X=190) + P(X=191) + ... + P(X=230).
Упрощённый способ через нормальную аппроксимацию:
- Находим параметры аппроксимирующего нормального распределения:
- μ = n * p = 400 * 0.5 = 200
- σ² = n * p * (1-p) = 400 * 0.5 * 0.5 = 100 → σ = 10
- Таким образом,
Xприближённо распределено какN(μ=200, σ=10). - Искомая вероятность
P(190 ≤ X ≤ 230)вычисляется как разность значений CDF в точках 230 и 190 для этого нормального распределения. - Результат: вероятность составляет около 85%.
Выводы:
Нормальное распределение — мощный инструмент для аппроксимации биномиального при больших n.
Использование CDF (кумулятивной функции распределения) кардинально упрощает вычисление вероятностей для интервалов.
Современные вычислительные инструменты (как Python) позволяют легко работать с нормальными распределениями с любыми параметрами, минуя устаревшие таблицы.
Ключевое практическое правило: в нормальном распределении ≈68% данных лежат в пределах одного стандартного отклонения (σ) от среднего (μ).