В теории вероятностей о вероятностях, законах распределения, параметрах случайных величин говорится как о чём-то данном, известном. Но встаёт вопрос: откуда их взять? Как найти параметры хотя бы приближённо? Как проверить предположение о том, что некоторая случайная величина распределена, например, по нормальному закону?

На эти и подобные им вопросы отвечает математическая статистика, причём информацию для ответов она берёт из наблюдений над случайными событиями и величинами. При этом наблюдения ведутся над реальными объектами и моделями, тогда как теория вероятностей изучает математические модели, в значительной степени идеализированные и абстрагированные. Соотношение между выводами математической теории и поведением реального мира приобретает уже не философский, а практический смысл. Можно сказать, что математическая статистика заведует связями теории вероятностей с внешним миром.

Ниже мы будем рассматривать одну единственную статистическую модель: предполагается, что существует случайная величина X, которую можно наблюдать повторно n раз в независимых опытах. Результатом таких наблюдений оказываются n значений, которые X приняла в n экспериментах: (x1, x2, ..., xn), – так называемая выборка, n – объём выборки. На все вопросы о случайной величине X математическая статистика берётся отвечать по выборке.

В каждом опыте мы наблюдаем одну и туже случайную величину X; все опыты по предположению независимы. Можно считать, что фактически мы наблюдаем n-мерную случайную величину (x1, x2, ..., xn) с независимыми компонентами, распределёнными одинаково – по тому же закону, что и X. Выборка (x1, x2, ..., xn) есть наблюдённое значение случайной величины (x1, x2, ..., xn), выборка – одно из её возможных значений; её можно представить точкой в n-мерном евклидовом пространстве. Всё множество точек, которые могут быть выборками, образует так называемое выборочное пространство. По сути дела выборка – элементарное событие, а выборочное пространство – пространство элементарных событий Ω. Часто смотрят на выборку (x1, x2, ..., xn) как на случайную величину и не вводят особого обозначения (x1, x2, ..., xn) для случайной величины.

Если X~N(a,σ), то выборочным пространством оказывается всё евклидово пространство Rn. Если , то выборочное пространство совпадает с целочисленной решёткой главного координатного угла. Если , то σ – единичный n-мерный куб.

Пусть – функция распределения случайной величины X. Тогда совместная функция распределения выборки:

Если X имеет плотность вероятности p(x, θ), то совместная плотность вероятности выборки равна

Познакомимся с важнейшими задачами математической статистики и с их статистическими решениями.


4.1. Относительная частота как оценка вероятности

Пусть имеется событие A, вероятность которого P(A)=p – неизвестна, и мы хотим найти её хотя бы приблизительно. Из курса теории вероятностей ответ нам известен: хорошим приближением для вероятности является относительная частота события. Если в n независимых опытах событие A произошло m раз, то . При этом:

1. В среднем мы не ошибаемся:

Это свойство оценки называется несмещённостью.

2. Дисперсия оценки как угодно мала при достаточно большом числе опытов:  при n→∞.

Дисперсия играет роль среднего квадрата ошибки.

3. Вероятность заметных отклонений относительной частоты от вероятности мала по закону больших чисел. Это свойство оценки называется состоятельностью. Оно может быть усилено, поскольку по закону больших чисел .

Итак, относительная частота – несмещённая, состоятельная оценка для вероятности со сколь угодно малой среднеквадратической ошибкой.

Разумеется, нужно понимать, что полученный ответ точно укладывается в рамки той единственной модели, которую мы взялись изучать в математической статистике.

Можно считать, что мы имеем здесь дело с биномиальной случайной величиной X, а выборка состоит из одного наблюдения m. Либо можно считать, что мы имеем дело здесь со случайной величиной

Очевидно, X – дискретная случайная величина с двумя возможными значениями 1 и 0, а вероятности этих значений p и q=1–p. Мы уже встречались с подобной величиной и выяснили, что MX=p, DX=pq.

Соответственно выборка (x1, x2, ..., xn) состоит из m единиц и n–m нулей, выборочное пространство состоит из вершин n-мерного единичного куба, и

так что ответ мы действительно получаем в терминах выборки:


4.2. Эмпирическая функция распределения, КАК ОЦЕНКА ФУНКЦИИ РАСПРЕДЕЛЕНИЯ

Пусть функция распределения случайной величины X неизвестна. Обозначим её F(x). Требуется хотя бы приблизительно её найти. Получим выборку (x1, x2, ..., xn) и по ней построим так называемую эмпирическую функцию распределения:

где m(x) – число наблюдений в выборке, оказавшихся меньше x.

Убедимся в том, что эмпирическая функция распределения – хорошее приближение для F(x).

Расположим наблюдения в порядке возрастания, причём повторяющиеся наблюдения выпишем лишь один раз: получим возрастающую последовательность y12<...r, называемую вариационным рядом; члены её называются порядковыми статистиками. Так,  – минимальная порядковая статистика – первый член вариационного ряда;  – максимальная порядковая статистика – последний член вариационного ряда. Пусть частота значения yi равна mi. Тогда очевидно:

В частности, если все наблюдения различны (так будет, например, почти наверное для непрерывной случайной величины X), то вариационный ряд состоит из n порядковых статистик и

Очевидно, Fn(x) – ступенчатая неотрицательная монотонная функция, имеющая разрывы в точках yi, где она совершает скачки величины .

Она обладает всеми свойствами функции распределения и задаёт закон распределения дискретной случайной величины с возможными значениями yi и вероятностями . Она и решает нашу задачу приближённого описания F(x).

Действительно, рассмотрим событие A={X < x}.

Его вероятность P(A)=P{X < x}=F(x), его абсолютная частота m=m(x), его относительная частота равна Fn(x), и мы свели рассматриваемую II задачу к I, ответ на которую мы уже знаем.

Следовательно, для любого x эмпирическая функция распределения Fn(x) приближённо равна F(x), причём Fn(x) обладает следующими свойствами:

1. , т. е. Fn(x) – несмещённая оценка F(x);

2. 

3.  – состоятельность оценки Fn(x).

Итак, эмпирическая функция распределения Fn(x) для любого x – несмещённая, состоятельная оценка F(x) со сколь угодно малой среднеквадратической ошибкой.


4.3. Среднее выборочное, как оценка математического ожидания

Требуется по выборке (x1, x2, ..., xn) оценить (т. е. приближённо найти) MX. Ответ нам уже известен: хорошим приближением для среднего значения случайной величины является среднее арифметическое наблюдений:

Очевидно, мы можем пользоваться теоремами о среднем арифметическом, применяя их к нашей выборке – последовательности одинаково распределённых независимых случайных величин. Будем предполагать, что X имеет MX=a, и DX=σ2.

1. В среднем мы не ошибаемся, поскольку (имеет место несмещённость).

2. Среднеквадратическая ошибка приближения как угодно мала при n→∞, поскольку .

3. подчиняется закону больших чисел Чебышёва, следовательно имеет место состоятельность.

В статистике принято называть средним выборочным. Таким образом, среднее выборочное – несмещённая состоятельная оценка для математического ожидания со сколь угодно малой дисперсией при достаточно большом объёме выборки.


4.4. Задача точечного оценивания

Пусть X~F(x, θ). Аналитический вид функции F(x, θ) известен, но значение параметра θ – неизвестно. Требуется: понаблюдав n раз X, найти θ хотя бы приближённо, т. е. требуется указать такую функцию от выборки , чтобы можно было считать её приближением для θ:

θ≈

Такая функция называется точечной оценкой параметра θ. Следует учитывать, что в данной постановке задачи параметр θ может быть векторным – состоять из нескольких компонент; например, нормальный закон определяется двумя параметрами: a и σ.

Предыдущие две задачи позволяют указать желательные свойства оценки:

1. Несмещенность: M=θ.

Несмещенность эквивалентна отсутствию систематической ошибки.

2. Среднеквадратическая ошибка должна быть достаточно мала. Обычно ищут оценки, для которых D→0 при n→∞; для них при достаточно большом объёме выборки среднеквадратическая ошибка оценки будет как угодно мала.

Иногда удаётся найти такую оценку , для которой дисперсия D минимальна по сравнению со всеми мыслимыми оценками. Такая оценка называется эффективной. Однако редко бывает так, что эффективная оценка, если она существует, имеет и достаточно простой вид, удобный для практических расчётов. Часто бывает выгоднее пользоваться неэффективными, но более простыми оценками, расплачиваясь увеличением объёма выборки.

Во всяком случае, при сравнении двух несмещённых оценок лучше та, у которой дисперсия меньше: она, как говорят, эффективнее другой.

3. Состоятельность: желательно, чтобы вероятность заметных отклонений от θ была достаточно мала. Это достигается, если оценка подчиняется закону больших чисел:

т. е., если сходится по вероятности к оцениваемому параметру. Ещё лучше, если имеет место обычная сходимость почти наверное.

Расскажем здесь о двух способах получения точечных оценок: о методе максимального правдоподобия и методе моментов.

Метод максимального правдоподобия Р. Фишера

Изложим этот метод отдельно для непрерывного и для дискретного случаев.

a. Пусть X – дискретная случайная величина с возможными значениями xi, вероятности которых pi(θ) зависят от неизвестного параметра θ; аналитический вид функций pi(θ) известен. Наблюдаем X независимым образом n раз. Пусть значение xiнаблюдалось mi раз. Вероятность получить ту выборку, которую мы получили, равна – функция неизвестного параметра θ.Изложим этот метод отдельно для непрерывного и для дискретного случаев.

При каких-то значениях θ она меньше, при других – больше. Если эта вероятность при некотором θ очень мала, то, надо полагать, такая выборка и не должна обычно наблюдаться. Но мы же её получили. Можно думать, что это произошло потому, что вероятность её получить достаточно велика. Принцип максимального правдоподобия состоит в том, чтобы в качестве оценки параметра θ брать то значение θ, при котором вероятность L(θ) нашей выборки максимальна. Функция L(θ) получила название функции правдоподобия, а значение , при котором функция правдоподобия достигает максимума, получило название оценки максимального правдоподобия параметра θ. Изложенное рассуждение есть лишь эвристическое соображение, основанное на здравом смысле, а не на строгой логике, и вполне могло привести нас к неудаче. Практическое применение принципа Фишера, однако, приводит часто к весьма разумным и полезным результатам. Они-то и оправдывают этот принцип.

b. Пусть X – непрерывная случайная величина с плотностью вероятности p(x, θ). Совместная плотность вероятности выборки равна и называется функцией правдоподобия.

Принцип максимального правдоподобия состоит здесь в том, чтобы в качестве оценки параметра θ брать точку , в которой L(θ) достигает максимума.

Сделаем несколько вычислительных замечаний.

Если L(θ) – дифференцируемая функция, то поиск максимума ведётся обычными средствами анализа: ищется корень уравнения L'(θ)=0 и проверяется, действительно ли в нём экстремум. Часто в этом случае удобнее искать максимум не функции L(θ), а функции lnL(θ), используя монотонность логарифма.

Если параметр θ меняется в конечном отрезке, то нужно исследовать также и концы отрезка.

Если параметр θ векторный, то вместо обычной производной приходится рассматривать частные производные.

Посмотрим, как действует этот метод на конкретных примерах.

1o. X~∏(λ), θ=λ. Функция правдоподобия:

Лишь конечное число сомножителей в выражении L(λ) отлично от единицы, так что вопрос о сходимости бесконечного произведения не встаёт.

Имеем:

и так как , то корнем является .

Т. к. L(λ) при λ>0 положительна и, очевидно, L(0)=0, , то экстремумом L(λ) может быть только максимум.

Поскольку параметр λ пуассоновской случайной величины является её математическим ожиданием, то результат , как мы знаем, весьма хорош.

2o. X~B(n, p). Считаем n известным, а p параметром: θ=p:

Функция правдоподобия:

Здесь не следует путать n с объёмом выборки, который равен .

Имеем:

Найдём корень производной функции lnL(p):

Корень полученного уравнения:

Мы вновь получили разумный результат, поскольку

Методом максимального правдоподобия Р. Фишера нами получена та же оценка математического ожидания биномиального закона, какую бы мы написали для np – выборочное среднее.

3o. Найдём оценку максимального правдоподобия для вероятности события A: P(A)=p, θ=p.

Будем считать, что n раз наблюдаются значения случайной величины

Функция правдоподобия:

– корень уравнения. На концах отрезка [0, 1] функция L(p) обращается в ноль, а в остальных точках отрезка она положительна, так что единственная точка экстремума является точкой максимума.

Таким образом, метод максимального правдоподобия советует брать в качестве оценки вероятности события A его относительную частоту, что, как мы знаем, хорошо.

4o.

Функция правдоподобия: , если xk≥0, и L(μ)≡0, если хотя бы одно из xk=0. Так как все выборочные значения xk положительны, то

Результат следует признать разумным, поскольку предлагается для брать в качестве приближения , а = MX.

5o. X ~ N(a, σ). Здесь параметр θ состоит из двух компонент: θ=(a,σ).

Функция правдоподобия: , откуда:

Уравнения для нахождения точки экстремума:

Отсюда находим точку экстремума

Таким образом, для нормального закона в качестве оценки максимального правдоподобия мы получаем: для параметра a – выборочное среднее, а для дисперсии σ2 – так называемую выборочную дисперсию (её обозначают S2):

Легко проверить, что точка () действительно является точкой максимума функции L(a, σ).

6o. X ~ R(a, b); θ = (a, b).

Плотность вероятности равномерного закона:

Функция правдоподобия:

Здесь мы имеем случай, когда максимум достигается не в корне производной, а в точке разрыва функции правдоподобия. Ясно, что максимум может достигаться лишь в случае, когда все наблюдения xk находятся в промежутке [a, b], а при этом выражение тем больше, чем ближе b к a, но сближать a и b можно лишь не выпуская все наблюдения из отрезка [a, b]. Следовательно, maxL(a, b) достигается при .

Перейдем теперь к методу моментов.

Метод моментов

Пусть , причём аналитический вид функции распределения случайной величины X известен. Для нахождения r неизвестных параметров нужно иметь r уравнений. Мы знаем, что хорошим приближением для функции распределения оказывается эмпирическая функция распределения: Fn(x)≈F(x). Можно надеяться, что и числовые характеристики этих функций также близки друг к другу, в частности, близки моменты. Эмпирическая функция распределения представляет собой закон распределения дискретной случайной величины, возможные значения которой совпадают с выборочными значениями xi, а вероятности их равны , в частности, для непрерывной случайной величины X с вероятностью 1 эти вероятности равны . Выражения для моментов эмпирической функции распределения Fn(x) (их называют выборочными моментами) нетрудно написать:

Необходимые нам уравнения для нахождения параметров θ1, θ2, ... , θr мы получим, приравнивая соответствующие моменты случайной величины X моментам распределения Fn(x):

(*)

или:

(**)

Успех этого метода в значительной степени зависит от того, сколь сложной оказывается соответствующая система уравнений ((*) или (**)). Решения системы и берутся в качестве оценок  для параметров θ1, θ2, ... , θr.

Например, для нормального закона система (**) имеет вид:

что совпадает с оценкой максимального правдоподобия, и это подтверждает разумность идеи.

Вообще, для произвольной случайной величины по методу моментов для математического ожидания – первого начального момента – мы получаем

а для дисперсии – второго центрального момента:

т. е. выборочную дисперсию. Первая оценка, как мы уже знаем, несмещенная, состоятельная, с дисперсией , которая при n→∞ сколь угодно мала. А второй оценкой займёмся здесь. В частности, обнаружим, что она имеет смещение, т. е. имеет систематическую погрешность.

С этой целью вычислим: . Итак, , что указывает на смещённость S2 как оценки для DX. Однако множитель для больших n близок к единице, и смещение асимптотически исчезает. Практики часто этой систематической ошибкой пренебрегают. Нетрудно её полностью исключить, если переписать последнее равенство в таком виде:

т.е. несмещенная оценка для дисперсии (обозначим её s2) равна

Вся поправка состоит лишь в том, чтобы делить сумму квадратов на число наблюдений без единицы.

Вместе с тем, этот пример показывает, что ни метод максимального правдоподобия, ни метод моментов не гарантируют несмещённости их оценок.

Отметим полезное тождество:

Мы решили здесь как частный случай задачу IV: нашли точечную несмещённую оценку дисперсии случайной величины X, имеющей дисперсию:


4.5. Оценка плотности вероятности

Пусть X – непрерывная случайная величина с плотностью вероятности p(x) (рис. 4). Требуется найти эту плотность, хотя бы приближённо, в точке x.

Рис. 4


Пусть Δ – произвольный достаточно малый интервал с центром в точке x.

Очевидно, если интервал Δ достаточно мал, а x – точка непрерывности плотности p(x), то

Здесь буквой Δ мы обозначили и интервал как множество точек, и его длину.

Отсюда:

(*)

причём ошибка этого приближения тем меньше, чем меньше Δ.

Стоящую в (*) вероятность P{X ∈ Δ} мы умеем приближённо оценивать частотой события , где mΔ – число наблюдений в выборке, попавших в интервал Δ. Ошибка этого приближения в среднем тем меньше, чем больше n и mΔ, а для того, чтобы mΔ было достаточно велико, нужно, чтобы интервал Δ был не слишком мал (иначе вероятность попасть в него при наблюдениях будет мала).

Итак:

и процедура оценки плотности выглядит следующим образом: производим группировку наблюдений и по интервальному вариационному ряду находим оценку плотности p(x) в точках :

Графически можно отложить ординаты длины в абсциссах . Далее появляются две возможности: можно либо соединить полученные точки ломаной линией – получим полигон частот (рис. 5), либо провести через них горизонтальные отрезки – получим гистограмму (рис. 6).

Рис. 5. Полигон частот


Рис. 6. Гистограмма


Полигон и гистограмма и дают приближение для плотности p(x). Закон больших чисел Бернулли и общеизвестные теоремы математического анализа позволяют утверждать, что в точках непрерывности плотности p(x) отклонения от неё гистограммы и полигона будут как угодно малы со сколь угодно большой вероятностью при достаточно больших n и N и достаточно малом Δ. Нужно помнить, что, с одной стороны, Δ нужно делать малым, чтобы уменьшить ошибку от замены интеграла площадью ступеньки, а с другой стороны, нельзя взять Δ слишком малым, чтобы не увеличить вероятностную ошибку от замены вероятности на относительную частоту.


4.6. Интервальное оценивание

Пусть X ~ F(x, θ), причём вид функции распределения F(x, θ) известен, а параметр θ неизвестен (считаем его одномерным). Требуется по выборке указать такой интервал [], который с заданной вероятностью P накрывает неизвестный параметр θ:

Сам интервал [] называется доверительным, а P – доверительной вероятностью. Концы интервала – функции от выборки:

и являются случайными величинами. Желательно иметь P близким к единице, а интервал – поменьше. Однако увеличивая P, мы будем получать всё более широкие интервалы и тем самым всё менее информативные интервалы, всё менее интересные. Желательным свойством можно считать условие: – 0, тогда при достаточно большом числе наблюдений можно как угодно точно локализовать параметр θ.

В качестве P обычно берут числа 0,99, 0,95, 0,9. Выбор доверительной вероятности зависит от практических последствий в случае, когда доверительный интервал не накроет θ. При P=0,9 следует ожидать, что в среднем мы будем промахиваться в десятой части всех применений данного доверительного интервала. Если это не страшно, то можно брать P=0,9. Если же нас в этих случаях ждут большие материальные потери или это ведёт к опасностям для человеческой жизни, то такая доверительная вероятность недопустимо мала.

Легко строить доверительный интервал для θ, если мы имеем для параметра точечную оценку и хотя бы приближённо знаем закон её распределения. Именно в этом случае по закону распределения , задавая P, мы можем находить такое y, чтобы

Иногда P называют надёжностью оценки, а y – её точностью. Здесь можно переписать неравенство под знаком вероятности в следующем виде:

и искомый доверительный интервал имеет вид [] и длину 2y.

Разберём несколько задач на построение доверительных интервалов.

1o. Приближённый доверительный интервал для вероятности события.

Пусть имеется событие A и для его вероятности P(A)=p мы хотим построить доверительный интервал, сделав n опытов. Допустим, что в этих опытах событие A наступило m раз.

По интегральной теореме Муавра-Лапласа:

Возьмём a=–y, b=y:

Стоящее под знаком вероятности неравенство заменим равносильным:

или, заменяя q на 1–p:

Кривая  как функция p является параболой.

Пусть её корни p1, p2, причём p1 < p2, т. е.

и теперь мы можем указать процедуру построения доверительного интервала для p:

a) Задаём доверительную вероятность P.

b) По P находим y из уравнения Φ(y)=P; корень уравнения легко определяется с помощью таблицы функции Лапласа.

c) Решаем квадратное уравнение , находим его корни p1, p2, p1 < p2.

d) Искомый приближённый доверительный интервал имеет вид: [p1, p2].

Точность этого интервала зависит от того, достаточно ли мала ошибка при использовании теоремы Муавра-Лапласа, можно ли практически считать, что

2o. Доверительный интервал для параметра a нормального закона при известном σ.

Пусть X ~ N(a, ), причём σ известно.

Получаем выборку (x1, x2, ... , xn). Среднее выборочное: . Его нормированное уклонение:

Поэтому:

Заменим неравенство под знаком вероятности равносильным, разрешив его относительно a:

и можно сформулировать процедуру построения доверительного интервала для параметра a:

a) Задаём доверительную вероятность P.

b) По P с помощью таблицы функции Лапласа находим y из уравнения Φ(y)=P.

c) Искомый доверительный интервал имеет вид ,

Отметим, что длина доверительного интервала сколь угодно мала при больших n: .

3o. Доверительные интервалы для параметров нормального закона.

Пусть X ~ N(a, ) и оба параметра неизвестны. Воспользуемся следующей теоремой о выборочном среднем и выборочной дисперсии S2 для выборки из нормального закона:

a) ;

b) ;

c) – независимые случайные величины;

d) .

Пункт a) этой теоремы очевиден, пункт d) следует из трёх предыдущих.

Действительно,

и из независимости и S следует, что отношение распределено по закону Стьюдента с (n–1) степенями свободы.

Пункты b) и c) примем без доказательства. Ограничимся только следующими замечаниями.

В выражении

слагаемые – квадраты случайных величин , распределённых по нормальному закону; если бы они были независимыми, то, как мы знаем, сумма была бы распределена по закону однако они связаны линейной зависимостью:

Оказывается, это влияет лишь на число степеней свободы у χ2, понижая его на единицу. Можно вместо величин (x1, x2, ... , xn) ввести с помощью линейного преобразования такие новые величины, которые остаются независимыми и нормальными, причем и S2 выражаются через различные новые переменные. Это и обеспечивает независимость. К тому же S2 выражается через квадраты ровно (n–1) таких новых величин, что и приводит к . Осуществление этой программы мы здесь опустим.

Теперь построить доверительный интервал для a уже нетрудно:

или

Строим доверительный интервал так:

a) Задаём P.

b) По P из таблицы распределения Стьюдента находим значение y из уравнения

c) Нужный интервал имеет вид:

Теорема о выборочном среднем позволяет построить доверительные интервалы также для σ2 и σ. Действительно, так как то для любых x1, x2, таких, что :

Перепишем неравенство под знаком вероятности, решив его относительно σ2:

Рис. 7.


Обычно выбирают x1, и x2 так, чтобы заштрихованные на рисунке площади были равны. Если мы хотим построить интервал с доверительной вероятностью P, то величина каждой из этих площадей, очевидно, равна .

Процедура построения интервала:

a) Задаём P.

b) Находим x1, и x2 по таблицам χ2-распределения из уравнений:

c) Вычисляем , что и решает нашу задачу.

Очевидно, для параметра σ доверительный интервал выглядит следующим образом:


4.7. Проверка статистических гипотез

Любое предположение о случайной величине X, законе её распределения, параметрах, числовых характеристиках и т. п. назовём статистической гипотезой. Решение принять или отвергнуть гипотезу H будем принимать по выборке. Всё выборочное пространство Ω распадается, таким образом, на два множества ΩH и , . При попадании выборочной точки в ΩH гипотеза H отвергается, при попадании в гипотеза H принимается. Множество ΩH называется критической областью для данной гипотезы H. Чтобы определить процедуру проверки гипотезы H, достаточно задать критическую область ΩH. При такой договорённости мы можем совершить ошибки двух родов: ошибка первого рода состоит в отвержении верной гипотезы, ошибка второго рода состоит в принятии неверной гипотезы. Конкретные примеры показывают, что часто эти ошибки имеют весьма различный характер и значительно отличаются по своим конкретным последствиям. Иногда одна из ошибок бывает заметно более опасной, чем другая, и гипотезу H обычно формулируют так, чтобы ошибка первого рода была более опасной, и мы будем стремиться контролировать прежде всего её. Чтобы переставить ошибки местами, достаточно проверять вместо H гипотезу .

Сужая критическую область, мы уменьшаем вероятность ошибки первого рода, но при этом, как правило, возрастает вероятность ошибки второго рода, и наоборот. Чтобы сделать вероятность ошибки первого рода равной нулю, достаточно взять ΩH=Ø, но при этом мы будем принимать и все неверные гипотезы; если взять ΩH=&Omega, то вероятность ошибки второго рода будет равна нулю, но при этом мы обязательно будем отвергать и все верные гипотезы. Уменьшая одну ошибку, мы расплачиваемся увеличением другой.

Во всей описанной схеме (её авторами являются Ю. Нейман и Д. Пирсон) ничего пока не говорилось о том, как гарантировать принятие истинной и отвержение ложной гипотезы. Основываясь на случайной выборке, мы не можем с абсолютной надёжностью (например, почти наверное) давать такую гарантию (исключение составляют лишь вырожденные случаи), а следовательно, не берёмся доказывать истинность или ложность гипотезы. Мы лишь проверяем, кажутся ли экспериментальные данные согласующимися с гипотезой, или, видимо, ей противоречат. Удовольствуемся следующим: будет хорошо, если отвергать верную гипотезу (т.е. совершать ошибку первого рода) и принимать ложную гипотезу (т.е. совершать ошибку второго рода) мы будем достаточно редко, – с заданной, достаточно малой или контролируемой удовлетворительной вероятностью.

Обозначим P и β вероятности ошибок первого и второго рода:

Отсюда ясно, что мы можем контролировать P, если знаем, при условии справедливости гипотезы H, закон распределения случайной величины X, и можем контролировать β, если знаем этот закон при условии справедливости гипотезы . Гипотезу, при которой закон распределения случайной величины X однозначно определяется, называют нулевой гипотезой. И здесь возникает существенная трудность: если гипотеза H нулевая, то обычно уже ненулевая и если H не верна, то мы, как правило, не знаем, что имеет место в действительности, а поэтому и не можем контролировать β. Выход может состоять в том, что мы вычисляем β для наиболее интересных, или наиболее опасных, или наиболее вероятных альтернатив.

Чаще всего критическая область строится с помощью некоторой функции от выборки K(x1, x2, ... , xn), называемой критерием. Ниже в наших примерах критическая зона определяется по критерию из неравенства K(x1, x2, ... , xn)>C, где C – пороговое значение критерия, и тогда вероятности ошибок выглядят так:

Из этих формул видно, что мы можем контролировать P и β, если будем знать закон распределения критерия K как случайной величины, хотя бы приближённо при условии справедливости гипотезы H и при условии справедливости гипотезы .

Для данной гипотезы H обычно удаётся подобрать такой критерий K, что закон распределения его при истинности гипотезы H известен, и P можно контролировать. Однако, при истинности мы, вообще говоря, не можем оценить β, но утешением оказывается то обстоятельство, что для хорошо подобранных критериев при n→∞ вероятность β→0, и хотя мы не можем её вычислить, всё-таки остается уверенность, что при достаточно большом объёме выборки ошибка второго рода будет как угодно мала. Известная опасность кроется в том, что мы, как правило, не можем сказать, достаточно ли большим является доступный нам объём выборки.

Максимально допустимую величину вероятности ошибки первого рода P называют уровнем значимости критерия; задав P, находят порог C из условия:

Обычные значения уровня значимости для практики: P=0,01; 0,05; 0,1. (В дискретном случае, правда, в качестве значений P могут быть не любые числа, и это надо учитывать, иначе только что написанное уравнение окажется неразре¬шимым). Уравнение же решается по таблицам точного или приближённого закона распределения критерия K.

Например, построив критическую область для уровня значимости P=0,05, мы должны считаться с тем, что в сотне применений критерия мы в среднем пять раз отвергнем гипотезу, которая на самом деле верна. Если фактические последствия этих ошибок нас не пугают, то можем пользоваться данной критической областью. Если же они представляются неприемлемыми, то можем уменьшить P, но при этом увеличится β, и мы должны взвесить: приемлемы ли для нас последствия ошибок второго рода. Если нет, то остаётся либо отказаться от изучаемого критерия, либо увеличить число наблюдений: для разумно выбранного критерия при этом P и β уменьшаются.

Критерий должен обладать свойством реагировать на правильность или ошибочность гипотезы: он должен иметь тенденцию быть малым, если гипотеза верна, и быть большим, если она ошибочна.

Ясно, что если критерий ведёт себя наоборот, т. е. принимает малые значения, если гипотеза ошибочна, и большая, если она верна, то это тоже нас устроит; нужно лишь составлять критическую область из малых значений критерия.

Рассмотрим три важнейших критерия математической статистики: Колмогорова, Пирсона, Стьюдента.

Критерий Колмогорова

Пусть X – непрерывная случайная величина. Проверяется гипотеза H: некоторая функция F(x) является ни чем иным, как функцией распределения случайной величины X.

А. Н. Колмогоров доказал следующую теорему:

если F(x) – истинная функция распределения, то при :

Стоящая справа сумма – одна из семейства тета-функций – табулирована и не представляет трудностей при работе.

Считаем, что n достаточно велико, чтобы было справедливо приближённое равенство:

Теорема Колмогорова подсказывает нам выбор критерия для проверки гипотезы H:

Если H верна, то эмпирическая функция близка к истинной функции распределения F(x): , и критерий имеет тенденцию быть малым. Если H не верна, то истинная функция распределения в какой-то области оси Ox отличается от на конечную величину, а поскольку близка к истинной функции распределения, то в этой области отклонение |-| конечно, а множитель делает критерий большим. Кроме того, по теореме Колмогорова мы приближённо знаем закон распределения.

Сформулируем процедуру проверки гипотезы H:

a) Задаём P.

b) Из таблицы распределения Колмогорова находим значение C из уравнения

c) Вычисляем K:

d) Сравниваем K и С: если K > С, то гипотезу H отвергаем, если K ≤ С, то H принимаем.

Ошибку второго рода контролировать эффективно не удаётся, так как распределения критерия при гипотезе мы не знаем. Однако можно доказать, что если H не верна, то при достаточно большом n из закона больших чисел следует, что критерий K отвергнет ошибочную гипотезу со сколь угодно большой вероятностью.

Недостатком критерия Колмогорова представляется то, что гипотеза должна точно задавать закон распределения . На практике чаще всего известен тип закона, но неизвестны параметры. Применение критерия Колмогорова не допускает оценки параметров по той же выборке, по которой вычисляется сам критерий, – это было бы прямой подгонкой. Однако, не запрещается оценить параметры по другой выборке, после чего функция распределения становится известной, и процедура проверки может применяться.

Критерий χ2 Пирсона

Пусть A1, A2, ... , Ak – полная группа попарно несовместных событий, p1, p2, ... , pk – их вероятности. Предположим, что в n независимых испытаниях эти события произошли, соответственно, m1, m2, ... , mk раз, . Как доказал Пирсон, в этих условиях

т.е. величина

в пределе имеет χ2-распределение с (k–1) степенями свободы.

Считаем n достаточно большим, чтобы можно было пользоваться приближённым равенством.

Теорема Пирсона лежит в основе проверки нескольких статистических гипотез.

Простейшая из них касается дискретной случайной величины X с возможными значениями x1, x2, ... , xk. Гипотеза H состоит в том, что вероятности этих значений p1, p2, ... , pk. Получаем выборку, которая состоит из m1, m2, ... , mk раз повторившихся возможных значений x1, x2, ... , xk. Применима теорема Пирсона, причём Ai={X=xi}, 1, 2, ... , k. Она подсказывает, что в качестве критерия следует взять величину

Приближённо закон её распределения даёт теорема Пирсона. Кроме того, mi как абсолютные частоты событий Ai, подчиняются биномиальному закону:

и, если гипотеза H верна, то , так что числители в сумме χ2, следует ожидать, малы, а знаменатели при достаточно большом n велики и критерий χ2 имеет тенденцию быть малым. Если же гипотеза H не верна, то ∃i, для которого

где p'i – истинное значение вероятности P{X=xi}. Числитель i-ого слагаемого близок к , а само слагаемое примерно равно , причём . При достаточно большом n мы попадём в критическую область, поскольку критерий имеет тенденцию быть большим для неверной гипотезы.

Итак, процедура проверки гипотезы H по критерию Пирсона выглядит следующие образом:

a) Задаём уровень значимости P.

b) По таблицам χ2-распределения находим пороговое значение C из уравнения

c) Вычисляем

d) Сравниваем χ2 и C: если χ2 > C, то H отвергается; если χ2 ≤ C, то H принимается.

Из изложенного ясно, что все приближения, допущенные в процессе проверки, будут с большой вероятностью удовлетворительными, если для ∀i будут достаточно большими величины npi. Поэтому, если ∃i, для которых pi слишком малы, следует проводить группировку наблюдений и соответственно менять гипотезу, присоединяя маловероятные значения xi к соседним или объединяя их вместе. Группировку наблюдений в соответствующую группировку возможных значений нужно, в частности, проводить в случае, если число возможных значений k бесконечно.

Ошибку второго рода вновь невозможно эффективно контролировать, так как, если H не верна, мы обычно не знаем, что же имеет место в действительности. Однако утешением является уверенность в том, что при достаточно большом n вероятность принять неверную гипотезу как угодно мала для сколь угодно близких альтернатив.

Критерий χ2 Пирсона можно применять и для проверки той же гипотезы, что и критерий Колмогорова: F(x) – функция распределения непрерывной случайной величины X. С этой целью разобьем ось Ox на интервалы Δi такие, чтобы вероятности были достаточно велики (достаточно велики должны быть числа npi). Роль событий Ai играют и проверяется гипотеза H: .

Пожалуй, все критерии выглядят более убедительными, когда они отвер¬гают гипотезу, чем когда они её принимают: первое заключение делается по событию, которое практически невероятно и всё-таки произошло, а второе – по событию, которое весьма вероятно и действительно произошло. Здесь же это различие особенно чувствуется, так как мы фактически деформировали гипотезу, заменили её следствием, из которого сама она не следует: если следствие отвергается, то отвергается и сама гипотеза; если же следствие принимается, это еще не доказывает верности самой гипотезы.

Выбор числа интервалов и их размеры определяются тем, чтобы в интервалы попадало достаточно большое число наблюдений: работа критерия Пирсона основана на том, сколь хорошо выполняется для ∀i приближение , если H справедлива, и сколь плохо выполняется оно хотя бы для некоторых i, если H не справедлива. А на это можно рассчитывать лишь при достаточно большом числе наблюдений, попавших в интервалы Δi.

Как оказалось, критерием χ2 Пирсона можно пользоваться и в том случае, когда гипотеза задаёт закон распределения с точностью до параметров, например, в дискретном случае

и r неизвестных параметров оцениваются по той же выборке, которая используется для проверки самой гипотезы.

Единственное изменение в процедуре проверки состоит в том, что в распределении χ2 нужно брать число степеней свободы не k–1, а k–r–1.

Критерий Стьюдента

Пусть случайная величина X распределена по нормальному закону, и проверяется гипотеза H, состоящая в том, что число a есть ни что иное, как математическое ожидание X:

Как мы установили выше, выборочное среднее и выборочная дисперсия подчиняются следующему закону:

Дробь Стьюдента распределена по закону, носящему его имя, с n–1 степенями свободы. При условии справедливости H

Эта теорема подсказывает выбор критерия для проверки гипотезы H:

a) Задаём P.

b) По таблицам распределения Стьюдента находим порог С из уравнения

c) Вычисляем

d) Сравниваем K и С: если K > С, то H отвергается; если K ≤ С, H принимается.

Можно видоизменить критерий Стьюдента для следующего случая: имеются две независимые нормальные случайные величины X и Y, и получены две выборки (x1, x2, ... , xk) и (y1, y2, ... , ym). Дисперсии равны, но неизвестны: σ1=σ2=σ. Проверяется гипотеза H: MX=MY.

Очевидно, в условиях справедливости H:

и мы можем составить дробь Стьюдента:

Очевидно, в качестве критерия нужно взять

с критической областью K > С.


4.8. Метод наименьших квадратов

Сначала изложим метод наименьших квадратов в невероятностной интерпретации, как метод решения задачи аппроксимации.

Начнём с простейшего – линейного – случая. На плоскости дано множество точек (xi, yi), i=1, 2, ... , n, явно располагающихся вблизи некоторой прямой. Из-за того, что глазу из всех линий проще всего выделить прямую, и того, что линейный случай часто встречается на практике, этот случай и занял особое место. Требуется в каком-то смысле наилучшим образом провести прямую, вокруг которой группируются точки. Обычно выбирают прямую, руководствуясь принципом наименьших квадратов: ищут прямую y=θ1x+θ0, максимизирующую сумму квадратов

Разность yi–θ1xi–θ0 интерпретируется как ошибка отклонения ординаты i-ой точки от искомой прямой. Выбор в качестве меры отклонения точек (xi, yi) от точек прямой – суммы квадратов ошибок условен: можно было бы взять, например, сумму модулей или сумму четвёртых степеней, однако это вызвало бы дополнительные аналитические и вычислительные трудности без видимых преимуществ. Как и все принципы, принцип наименьших квадратов не требует доказательства; он опирается на здравый смысл, а его полезность и разумность подтверждается практическим его применением.

Найдем прямую, минимизирующую δ, обычным способом:

или

Решение очевидно:

Аналогично по множеству точек (xi, yi) можно искать аппроксимирующий полином   степени k. При этом мы должны минимизировать сумму квадратов

Соответствующая система уравнений для неизвестных коэффициентов θ0, θ1, ... , θk называется системой нормальных уравнений и имеет вид:

В каждой сумме индекс суммирования i меняется от 1 до n.

Решение полученной системы линейных неоднородных уравнений легко определяется по правилу Крамера.

Удобно записать систему нормальных уравнений в сокращённом матричном виде. Для этого определим три матрицы-столбца:

и так называемую структурную матрицу размера (k+1)×n:

Тогда легко проверить, что система нормальных уравнений записывается в форме:

где AT – матрица, транспонированная по отношению к матрице A.

Если матрица AATAT имеет обратную, то решение системы нормальных урав¬нений сразу выписывается

Формулы линейного случая входят сюда как частный случай при k=1.

Заменой функций и переменных к рассмотренным случаям можно свести и многие неполиномиальные зависимости. Например, для y=, вместо точек (xi, yi) можно рассматривать точки (lnxi, yi): получаем линейную зависимость с помощью введения логарифмического масштаба по одной из осей.

Для функции y= следует взять точки 1, 2, ... , n, и т. д.

Полиномиальная аппроксимация часто появляется в следующем варианте: если мы аппроксимируем точки функцией f(x), то для аналитических функций бывает возможно ограничиться частью степенного ряда, дающей достаточную точность.

Описанная задача часто применяется практиками, и в таком виде метод наименьших квадратов не имеет никакого отношения к теории вероятностей. Он возникает как задача аппроксимации, как сокращённый аналитический способ представления наблюдений.

Вероятностный аспект появляется, например, в такой ситуации: имеются две физические величины, связанные детерминированным законом

но значения коэффициентов неизвестны и строгое выполнение закона не вызывает сомнений. Значение переменной x при эксперименте пусть задаётся точно, а в измерение величины y вкрадываются ошибки, так что опытные точки (xi, yi), i=1, 2,  , n, могут даже не удовлетворять уравнению. Если бы ошибок при измерении величины y не было, то достаточно было бы (k+1) наблюдений, что¬бы найти все коэффициенты. Ошибки приводят к тому, что, если пытаться решать систему

то она обычно оказывается противоречивой, несовместной.

Выход указывает принцип наименьших квадратов. Состоит он в том, чтобы выбрать коэффициенты, минимизируя сумму квадратов ошибок

Вероятностный подход даёт возможность увидеть, когда принцип наименьших квадратов, как он сформулирован, хорош и когда плох. В сумму δ те точки, которые лежат на искомой кривой, вносят нулевой вклад; наибольший же вклад вносят наиболее ошибочные наблюдения, именно они и начинают особенно заметно влиять на результат, хотя менее всего заслуживают такого влияния. В особенности плохо, когда на оси Ox есть участки наиболее точных измерений и участки очень грубых измерений. Участки грубых наблюдений получают право определять сумму, вносить в неё основной вклад. Ясно, что наиболее естественный случай применения принципа наименьших квадратов – случай, когда априори средний квадрат ошибок одинаков во всех наблюдениях. Если систематических погрешностей в измерениях нет, т. е. для ∀i, то это означает, что дисперсии ошибок должны быть одинаковы, или как говорят, наблюдения должны быть равноточными.

Если же наблюдения не равноточные, но дисперсии известны: , то можно внести коррективы в принцип наименьших квадратов, введя в сумму δ весовые множители, уравнивающие априорный вклад в сумму всех наблюдений, минимизировать

К сожалению, как правило, параметры бывают неизвестны, и практики обрабатывают наблюдения так, словно они равноточные.

Чаще всего, когда путем замены x и y приводят зависимость y=f(x) к линейной или полиномиальной с целью применить метод наименьших квадратов, то нарушают именно равноточностъ измерений, если она до этого была, придавая повышенный вес одним участкам наблюдений перед другими, причём обычно этот факт практиками молчаливо игнорируется. По поводу этого, однако, можно сказать, как и по поводу любого принципа, что если последствия его применения, связанные с ним ошибки нас устраивают, не чрезмерны, то всё в порядке.

В таком изложении метод наименьших квадратов применим к ошибкам yi, как угодно распределённым. Если же ошибки распределены по нормальному закону: , то полученные по методу наименьших квадратов оценки параметров θ0, θ1, ... , θk совпадают с их оценками по методу максимального правдоподобия: ведь неизвестные коэффициенты θ0, θ1, ... , θk становятся параметрами распределения случайной величины y.


4.9. Примеры решения задач по теме

Задача 1. Методом моментов по выборке

найти точечную оценку параметра λ, предполагая, что теоретическое распределение является показательным:

Решение. Согласно методу моментов нужно приравнять начальный теоретический момент первого порядка (математическое ожидание ) к начальному эмпирическому моменту первого порядка (выборочному среднему ): = .

По формулам (18) для показательного распределения имеем: . Выборочное среднее находим по формуле :

где xi - варианта выборки, ni - частота xi, - объем выборки.

Получаем .

Приравнивая моменты, находим λ: .

Задача 2. Найти доверительный интервал для оценки математического ожидания нормального распределения при доверительной вероятности (надежности), равной γ=0,975, если выборочное среднее =12, среднее квадратическое отклонение σ=5, а объем выборки n=100.

Решение. Доверительный интервал для математического ожидания при нормальном распределении равен (28):

где - выборочное среднее, σ - среднее квадратическое отклонение, n - объем выборки, , , Φ(x) - затабулированная функция Лапласа .

Так как , из соотношения получаем и с помощью таблиц находим tγ=2,24. Тогда и .

Задача 3. По выборке из 24 вариант выдвинута гипотеза о нормальном распределении генеральной совокупности. Используя критерий Пирсона при уровне значимости α=0,025 среди заданных значений χ2 = {34, 35, 36, 37, 38} указать: а) наибольшее, для которого нет оснований отвергать гипотезу; б) наименьшее, начиная с которого гипотеза должна быть отвергнута.

Решение. Найдем число степеней свободы k с помощью формулы

где S - число групп выборки (вариант), r - число параметров распределения.

Так как нормальное распределение имеет 2 параметра ( m и σ), получаем

По таблице критических точек распределения χ2 [1], по заданному уровню значимости α=0,025 и числу степеней свободы k=21 определяем критическую точку

В случае а) для значений χ2, равных 34 и 35, нет оснований отвергать гипотезу о нормальном распределении, так как . А наибольшее среди этих значений .

Задача 4. По данным корреляционной таблицы найти выборочный корреляционный момент (ковариацию):

Решение. Выборочный корреляционный момент определяется равенством :

Здесь x, y - варианты (наблюдавшиеся значения) признаков X и Y, nxy - частота пары вариант (x,y), n - объем выборки, - выборочные средние.

Найдем выборочные средние с помощью соотношения (27):

где - частоты вариант x и y.

Так как n = 20 + 10 + 30 + 10 + 20 + 10 = 100, получаем

Тогда

Задача 5. Найти выборочное уравнение прямой линии регрессии:

а) Y на X, б) X на Y , если известны: выборочные средние =3,6, =4, выборочные дисперсии Dx=0,04, Dy=0,25, выборочный коэффициент корреляции rB=0,6.

Решение. а) Выборочное уравнение прямой линии регрессии Y на X имеет вид (31)

где

Поскольку , получаем уравнение

б) Согласно выборочному уравнению прямой линии регрессии X на Y (32):

Поэтому получаем

, или .


4.10. Контрольное задание

По данным задач № 1-10 необходимо:

1. Начертить графики: полигон, гистограмм, эмпирическую функцию распределения.

2. Вычислить среднюю арифметическую, дисперсию, среднее квадратическое отклонение.

3. Рассчитать и построить теоретические нормальные кривые f(х) и F(х).

4. Определить вероятность Р(х1 < х < х2).

5. Произвести оценку степени близости теоретического распределения эмпирическому ряду с помощью критерия согласия Пирсона.


1. Распределение затрат на 100 руб. продукции по предприятиям хлопчатобумажной промышленности.

Р (98,4 < х < 101,2) = ?

2. Распределение объема товарной продукции на 1 кв.м производственной площади (в млн.руб.)

Р (0,35 < х < 1,03) = ?

3 Распределение объема основных фондов (млрд.руб.) предприятий трикотажной промышленности.

Р (2,29 < х < 2,97) = ?

4. Распределение оплаты труда на одном из малых предприятий за месяц.

Р (275 < х < 342) = ?

5. Распределение производственных площадей (тыс.м2) предприятий текстильной промышленности.

Р (2,31 < х < 2,99) = ?

6. Распределение средних удоев молока в фермерском хозяйстве (литров) от одной коровы за день.

Р (15,4 < х < 28,4) = ?

7. Распределение средней урожайности (ц/га) в фермерских хозяйствах области.

Р (23,4 < х < 32,9) = ?

8. Распределение декадной выручки от реализации (млн.руб.) в коммерческих торговых палатках микрорайона.

Р (31,7 < х < 32,4) = ?

9. Распределение длины резьбы на муфте вентилей (в мм).

Р (51,9 < х < 52,4) = ?

10. Распределение индекса цен по группе продовольственных товаров (%).

Р (х > 100) = ?