Ошибки выборки. Задачи, решаемые при применении выборочного наблюдения. Средняя ошибка выборки

При выборочном наблюдении должна быть обеспечена слу-чайность отбора единиц. Каждая единица должна иметь равную с другими возможность быть отобранной. Именно на этом основывается собственно-случайная выборка.

К собственно-случайной выборке относится отбор единиц из всей генеральной совокупности (без предварительного рас-членения ее на какие-либо группы) посредством жеребьевки (преимущественно) или какого-либо иного подобного спосо-ба, например, с помощью таблицы случайных чисел. Случай-ный отбор -- это отбор не беспорядочный. Принцип случай-ности предполагает, что на включение или исключение объ-екта из выборки не может повлиять какой-либо фактор, кро-ме случая. Примером собственно-случайного отбора могут служить тиражи выигрышей: из общего количества выпущен-ных билетов наугад отбирается определенная часть номеров, на которые приходятся выигрыши. Причем всем номерам обеспечивается равная возможность попадания в выборку. При этом количество отобранных в выборочную совокупность единиц обычно определяется исходя из принятой доли выборки.

Доля выборки есть отношение числа единиц выборочной со-вокупности к числу единиц генеральной совокупности:

Так, при 5%-ной выборке из партии деталей в 1000 ед. объ-ём выборки п составляет 50 ед., а при 10%-ной выборке -- 100 ед. и т.д. При правильной научной организации выборки ошибки репрезентативности можно свести к минимальным значениям, в результате -- выборочное наблюдение становится достаточно точным.

Собственно-случайный отбор «в чистом виде» применяет-ся в практике выборочного наблюдения редко, но он является исходным среди всех других видов отбора, в нем заключаются и реализуются основные принципы выборочного наблюдения.

Рассмотрим некоторые вопросы теории выборочного метода и формулы ошибок для простой случайной выборки.

Применяя выборочный метод в статистике, обычно используют два основных вида обобщающих показателей: среднюю величину ко-личественного признака и относительную величину альтернативного признака (долю или удельный вес единиц в статистической совокупности, которые отличаются от всех других единиц этой сово-купности только наличием изучаемого признака).

Выборочная доля (w), или частость, определяется отношением числа единиц, обладающих изучаемым признаком т, к общему числу единиц выборочной совокупности п:

Например, если из 100 деталей выборки (n =100), 95 деталей оказались стандартными (т =95), то выборочная доля

w =95/100=0,95 .

Для характеристики надежности выборочных показателей различают среднюю и предельную ошибки выборки.

Ошибка выборки ? или, иначе говоря, ошибка репрезента-тивности представляет собой разность соответствующих выбо-рочных и генеральных характеристик:

Ошибка выборки свойственна только выборочным наблюде-ниям. Чем больше значение этой ошибки, тем в большей степе-ни выборочные показатели отличаются от соответствующих генеральных показателей.

Выборочная средняя и выборочная доля по своей сути яв-ляются случайными величинами, которые могут принимать раз-личные значения в зависимости от того, какие единицы сово-купности попали в выборку. Следовательно, ошибки выборки также являются случайными величинами и могут принимать различные значения. Поэтому определяют среднюю из возмож-ных ошибок -- среднюю ошибку выборки.

От чего зависит средняя ошибка выборки? При соблюдении принципа случайного отбора средняя ошибка выборки определя-ется прежде всего объемом выборки: чем больше численность при прочих равных условиях, тем меньше величина средней ошибки выборки. Охватывая выборочным обследованием все большее количество единиц генеральной совокупности, всё более точно характеризуем всю генеральную совокупность.

Средняя ошибка выборки также зависит от степени варьи-рования изучаемого признака. Степень варьирования, как из-вестно, характеризуется дисперсией? 2 или w(1-w) -- для альтернативного признака. Чем меньше вариация признака, а следовательно, и дисперсия, тем меньше средняя ошибка вы-борки, и наоборот. При нулевой дисперсии (признак не варь-ирует) средняя ошибка выборки равна нулю, т. е. любая еди-ница генеральной совокупности будет совершенно точно ха-рактеризовать всю совокупность по этому признаку.

Зависимость средней ошибки выборки от ее объема и степе-ни варьирования признака отражена в формулах, с помощью которых можно рассчитать среднюю ошибку выборки в условиях выборочного наблюдения, когда генеральные характеристики (х,p) неизвестны, и следовательно, не представляется возмож-ным нахождение реальной ошибки выборки непосредственно по формулам (форм. 1), (форм. 2).

Ш При случайном повторном отборе средние ошибки теоретически рассчитывают по следующим формулам:

* для средней количественного признака

* для доли (альтернативного признака)

Поскольку практически дисперсия признака в генеральной совокупности? 2 точно неизвестна, на практике пользуются значением дисперсии S 2 , рассчитанным для выборочной сово-купности на основании закона больших чисел, согласно кото-рому выборочная совокупность при достаточно большом объеме выборки достаточно точно воспроизводит характеристики гене-ральной совокупности.

Таким образом, расчетные формулы средней ошиб-ки выборки при случайном повторном отборе будут следующие:

* для средней количественного признака

* для доли (альтернативного признака)

Однако дисперсия выборочной совокупности не равна диспер-сии генеральной совокупности, и следовательно, средние ошибки выборки, рассчитанные по формулам (форм. 5) и (форм. 6), будут прибли-женными. Но в теории вероятностей доказано, что генеральная дисперсия выражается через выборную следующим соотношением:

Так как п/ (n -1) при достаточно больших п -- величина, близкая к единице, то можно принять, что, а следова-тельно, в практических расчетах средних ошибок выборки мож-но использовать формулы (форм. 5) и (форм. 6). И только в случаях ма-лой выборки (когда объем выборки не превышает 30) необхо-димо учитывать коэффициент п /(n -1) и исчислять среднюю ошибку малой выборки по формуле:

Ш X При случайном бесповторном отборе в приведенные выше формулы расчета средних ошибок выборки необходимо подко-ренное выражение умножить на 1-(n/N), поскольку в процес-се бесповторной выборки сокращается численность единиц генеральной совокупности. Следовательно, для бесповторной вы-борки расчетные формулы средней ошибки выборки примут такой вид:

* для средней количественного признака

* для доли (альтернативного признака)

. (форм. 10)

Так как п всегда меньше N , то дополнительный множи-тель 1-(n/N ) всегда будет меньше единицы. Отсюда следу-ет, что средняя ошибка при бесповторном отборе всегда будет меньше, чем при повторном. В то же время при сравнительно небольшом проценте выборки этот множитель близок к еди-нице (например, при 5%-ной выборке он равен 0,95; при 2%-ной -- 0,98 и т.д.). Поэтому иногда на практике пользуются для определения средней ошибки выборки формулами (форм. 5) и (форм. 6) без указанного множителя, хотя выборку и организуют как бесповторную. Это имеет место в тех случаях, когда число единиц генеральной совокупности N неизвестно или безгра-нично, или когда п очень мало по сравнению с N , и по су-ществу, введение дополнительного множителя, близкого по значению к единице, практически не повлияет на значение средней ошибки выборки.

Механическая выборка состоит в том, что отбор единиц в выборочную совокупность из генеральной, разбитой по ней-тральному признаку на равные интервалы (группы), произво-дится таким образом, что из каждой такой группы в выборку отбирается лишь одна единица. Чтобы избежать систематиче-ской ошибки, отбираться должна единица, которая находится в середине каждой группы.

При организации механического отбора единицы совокуп-ности предварительно располагают (обычно в списке) в опре-деленном порядке (например, по алфавиту, местоположению, в порядке возрастания или убывания значений какого-либо по-казателя, не связанного с изучаемым свойством, и т.д.), после чего отбирают заданное число единиц механически, через оп-ределенный интервал. При этом размер интервала в генеральной совокупности равен обратному значению доли выборки. Так, при 2%-ной выборке отбирается и проверяется каждая 50-я единица (1: 0,02), при 5%-ной выборке -- каждая 20-я едини-ца (1: 0,05), например, сходящая со станка деталь.

При достаточно большой совокупности механический отбор по точности результатов близок к собственно-случайному. По-этому для определения средней ошибки механической выборки используют формулы собственно-случайной бесповторной вы-борки (форм. 9), (форм. 10).

Для отбора единиц из неоднородной совокупности применя-ется, так называемая типическая выборка , которая используется в тех случаях, когда все единицы генеральной совокупности можно разбить на несколько качественно однородных, однотипных групп по признакам, влияющим на изучаемые показатели.

При обследовании предприятий такими группами могут быть, например, отрасль и подотрасль, формы собственности. Затем из каждой типической группы собственно-случайной или механической выборкой производится индивидуальный отбор единиц в выборочную совокупность.

Типическая выборка обычно применяется при изучении слож-ных статистических совокупностей. Например, при выборочном обследовании семейных бюджетов рабочих и служащих в отдель-ных отраслях экономики, производительности труда рабочих пред-приятия, представленных отдельными группами по квалификации.

Типическая выборка дает более точные результаты по сравнению с другими способами отбора единиц в выбороч-ную совокупность. Типизация генеральной совокупности обеспечивает репрезентативность такой выборки, представи-тельство в ней каждой типологической группы, что позволяет исключить влияние межгрупповой дисперсии на среднюю ошибку выборки.

При определении средней ошибки типической выборки в ка-честве показателя вариации выступает средняя из внутригрупповых дисперсий.

Среднюю ошибку выборки находят по формулам:

* для средней количественного признака

(повторный отбор); (форм. 11)

(бесповоротный отбор); (форм. 12)

* для доли (альтернативного признака)

(повторный отбор); (форм.13)

(бесповторный отбор), (форм. 14)

где - средняя из внутригрупповых дисперсий по вы-борочной совокупности;

Средняя из внутригрупповых дисперсий доли (альтернативного признака) по выборочной совокупности.

Серийная выборка предполагает случайный отбор из генераль-ной совокупности не отдельных единиц, а их равновеликих групп (гнезд, серий) с тем, чтобы в таких группах подвергать наблюде-нию все без исключения единицы.

Применение серийной выборки обусловлено тем, что многие товары для их транспортировки, хранения и продажи упаковываются в пачки, ящики и т.п. Поэтому при контроле качества упакованного товара рациональнее проверить не-сколько упаковок (серий), чем из всех упаковок отбирать необходимое количество товара.

Поскольку внутри групп (серий) обследуются все без исключе-ния единицы, средняя ошибка выборки (при отборе равновеликих серий) зависит только от межгрупповой (межсерийной) дисперсии.

Ш Среднюю ошибку выборки для средней количественного признака при серийном отборе находят по формулам:

(повторный отбор); (форм.15)

(бесповторный отбор), (форм. 16)

где r - число отобранных серий; R - общее число серий.

Межгрупповую дисперсию серийной выборки вычисляют сле-дующим образом:

где - средняя i - й серии; - общая средняя по всей выбо-рочной совокупности.

Ш Средняя ошибка выборки для доли (альтернативного при-знака) при серийном отборе:

(повторный отбор); (форм. 17)

(бесповторный отбор). (форм. 18)

Межгрупповую (межсерийную) дисперсию доли серийной вы-борки определяют по формуле:

, (форм. 19)

где - доля признака в i -й серии; - общая доля признака во всей выборочной совокупности.

В практике статистических обследований помимо рассмот-ренных ранее способов отбора применяется их комбинация (комбинированный отбор).

Формула доверительной вероятности при оценке генераль ной доли признака. Средняя квадратическая ошибка повторной и бесповторной выборок и построение доверительного интервала для генеральной доли признака.

Формула доверительной вероятности при оценке генеральной средней. Средняя квадратическая ошибка повторной и бесповторной выборок и построение доверительного интервала для генеральной средней.

Построение доверительного интервала для гeнеральной средней и гeнеральной доли по большим выборкам . Для построения доверительных интервалов для параметров генеральных совокупностей м.б. реализованы 2 подхода, основанных на знании точного (при данном объеме выборки n) или асимптотического (при n → ∞) распределения выборочных характеристик (или некоторых функций от них). Первый подход реализован далее при построении интервальных оценок параметров для малых выборок. В данном параграфе рассматривается второй подход, применимый для больших выборок (порядка сотен наблюдений).

Теорема . Вер-ть того, что отклонение выборочной средней (или доли) от генеральной средней (или доли) не превзойдет число Δ > 0 (по абсолютной величине), равна:

Где

Где
.

Ф(t) - функция (интеграл вероятностей) Лапласа.

Формулы получили название формул доверительной вер-ти для средней и доли .

Среднее квадратическое отклонение выборочной средней и выборочной долисобственно-случайной выборки называетсясредней квадратической (стандартной) ошибкой выборки (для бесповторной выборки обозначаем соответственно и).

Следствие 1 . При заданной доверительной вер-ти γ предельная ошибка выборки равна t-кратной величине средней квадратической ошибки, где Ф(t) = γ, т.е.

Следствие 2 . Интервальные оценки (доверительные интервалы) для генеральной средней и генеральной доли могут быть найдены по формулам:

Определение необходимого объема повторной и бесповторной выборок при оценке генеральной средней и доли.

Для проведения выборочного наблюдения весьма важно правильно установить объем выборки n, к-ый в значительной степени определяет необходимые при этом временные, трудовые и стоимостные затраты для определения n необходимо задать надежность (доверительную вер-ть) оценки γ и точность (предельную ошибку выборки) Δ.

Если найден объем повторной выборки n, то объем соответствующей бесповторной выборки n" можно определить по формуле:

Т.к.
, то при одних и тех же точности и надежности оценок объем бесповторной выборки n" всегда меньше объема повторной выборки n.

Статистическая гипотеза и статистический критерий. Ошибки 1-го и 2-го рода. Уровень значимости и мощность критерия. Принцип практической уверенности.

Определение . Статистической гипотезой называется любое предположение о виде или параметрах неизвестного закона распределения.

Различают простую и сложную статистические гипотезы . Простая гипотеза , в отличие от сложной, полностью определяет теоретическую функцию распределения СВ.

Проверяемую гипотезу обычно называют нулевой (или основной ) и обозначают Н 0 . Наряду с нулевой гипотезой рассматривают альтернативную , или конкурирующую , гипотезу H 1 , являющуюся логическим отрицанием Н 0 . Нулевая и альтернативная гипотезы представляют собой 2 возможности выбора, осуществляемого в задачах проверки статистических гипотез.

Суть проверки статистической гипотезы заключается в том, что используется специально составленная выборочная характеристика (статистика)
, полученная по выборке
, точное или приближенное распределение которой известно.

Затем по этому выборочному распределению определяется критическое значение - такое, что если гипотеза Н 0 верна, то вер-ть
мала; так что в соответствии с принципом практической уверенности в условиях данного исследования событие
можно (с некоторым риском) считать практически невозможным. Поэтому, если в данном конкретном случае обнаруживается отклонение
, то гипотеза Н 0 отвергается, в то время как появление значения
, считается совместимым с гипотезой Н 0 , которая тогда принимается (точнее, не отвергается). Правило, по которому гипотеза Н 0 отвергается или принимается, называется статистическим критерием или статистическим тестом .

Принцип практической уверенности:

Если вер-ть события А в данном испытании очень мала, то при однократном выполнении испытания можно быть уверенным в том, что событие А не произойдет, и в практической д-ти вести себя так, как будто событие А вообще невозможно.

Т.о., множество возможных значений статистики - критерия (критической статистики) разбивается на 2 непересекающихся подмножества:критическую область (область отклонения гипотезы) W и область допустимых значений (область принятия гипотезы) . Если фактически наблюдаемое значение статистики критерияпопадает в критическую область W, то гипотезу Н 0 отвергают. При этом возможны четыре случая:

Определение . Вероятность α допустить ошибку l-го рода, т.е. отвергнуть гипотезу Н 0 , когда она верна, называется уровнем значимости , или размером критерия .

Вероятность допустить ошибку 2-го рода, т.е. принять гипотезу Н 0 , когда она неверна, обычно обозначают β.

Определение . Вероятность (1-β) не допустить ошибку 2-го рода, т.е. отвергнуть гипотезу Н 0 , когда она неверна, называется мощностью (или функцией мощности ) критерия .

Следует предпочесть ту критическую область, при которой мощность критерия будет наибольшей.

Понятие и расчет ошибки выборки.

Задачей выборочного наблюдения является дача верных представлений о сводных показателях всей совокупности на основе некоторой их части, подвергнутой наблюдению. Возможное отклонение выборочной доли и выборочной средней от доли и средней в генеральной совокупности называется ошибкойвыборки или ошибкойрепрезентативности. Чем больше величина этой ошибки, тем больше показатели выборочного наблюдения отличаются от показателей генеральной совокупности.

Различаются:

Ошибки выборки;

Ошибки регистрации.

Ошибки регистрации возникают при неправильном установлении факта в процессе наблюдения. Они свойственны как сплошному наблюдению, так и выборочному, но в выборочном их меньше.

По природе ошибки бывают:

Тенденциозные – преднамеренные, т.е. были отобраны либо лучшие, либо худшие единицы совокупности. При этом наблюдения теряют смысл;

Случайные – основной организационный принцип выборочного наблюдения состоит в том, чтобы не допустить преднамеренного отбора, т.е. обеспечить строгое соблюдение принципа случайного отбора.

Общим правилом случайного отбора является: у отдельных единиц генеральной совокупности должны быть совершенно одинаковые условия и возможности упасть в число единиц, входящих в выборку. Это характеризует независимость результата выборки от воли наблюдателя. Воля же наблюдателя порождает тенденциозные ошибки. Ошибка выборки при случайном отборе носит случайный характер. Она характеризует размеры отклонений генеральных характеристик от выборочных.

В связи с тем, что признаки в изучаемой совокупности варьируют, то состав единиц, попавших в выборку, может не совпадать с составом единиц всей совокупности. Это означает, что Р и не совпадают с W и . Возможное расхождение между этими характеристиками определяется ошибкой выборки, которая определяется по формуле:

где - генеральная дисперсия.

где - выборочная дисперсия.

Отсюда видно, где генеральная дисперсия отличается от выборочной дисперсии в раз.

Существует повторный и бесповторный отбор. Сущность повторного отбора состоит в том, что каждая, попавшая в выборку единица, после наблюдения возвращается в генеральную совокупность и может быть исследована повторно. При повторном отборе средняя ошибка выборки рассчитывается:

Для показателя доли альтернативного признака дисперсия выборки определяется по формуле:

На практике повторный отбор применяется редко. При бесповторном отборе, численность генеральной совокупности N в ходе выборки сокращается, формула средней ошибки выборки для количественного признака имеет вид:

, тогда

Одно из возможных значений, в которых может находиться доля изучаемого признака равно:

где - ошибка выборки альтернативного признака.

Пример .

При выборочном обследовании 10 % изделий партии готовой продукции по методу без повторного отбора получены следующие данные о содержании влаг в образцах.

Определить средний % влажности, дисперсию, среднее квадратическое отклонение, с вероятностью 0,954 возможные пределы, в которых ожидается ср. % влажности всей готовой продукции, с вероятность 0,987 возможные пределы удельного веса стандартной продукции при условии, что к нестандартной партии относятся изделия с влажностью до 13 и выше 19 %.

Лишь с определенной вероятностью можно утверждать, что генеральная доля от выборочной доли и генеральная средняя от выборочной средней, отклоняются в t раз.

В статистике эти отклонения называются предельнымиошибкамивыборки и обозначаются .

Вероятность суждений можно повысить или понизить в t раз. При вероятности 0,683 , при 0,954 , при 0,987 , тогда показатели генеральной совокупности по показателям выборки определяются.

Зачем эта презентация? Во-первых, «средняя квадратическая / стандартная ошибка выборки» – длинное и сложное название, которое часто обрубают в задачах до «средней» или «стандартной» ошибки. То, что это одно и то же, в свое время было для меня настоящим открытием. Эта пресловутая ошибка бывает разная и записывается всегда по-разному, что здорово путает. Оказывается, эта штука много где попадается, но постоянно меняет обличья. Из-за этого мы зубрим целую кучу формул, когда можно обойтись однойдвумя.

Как ее обозначают? Как только не измывались над несчастной! Это варианты написания стандартной ошибки для средней в лекциях и учебниках. Над ошибкой доли издевались точно так же, или вообще забыли о ее существовании и записывали сразу формулой, что здорово путает несчастных студентов. Здесь я обозначу ее через «ε» , потому что это, хвала Богам, редкая буква, и ее не перепутать ни с моментом, ни с выборочным СКО.

Собственно, формула (корень из дисперсии на число элементов в выборке или СКО разделить на корень из объема выборки) Это основная формула, фундамент, основа основ. Достаточно выучить только её, а дальше просто поработать головой! Как? Читай дальше!

Разновидности и откуда они взялись 1. Для доли. У доли дисперсия считается необычно. Если долю изучаемого признака взять за p, а долю «всего остального» - за q, то дисперсия равна p*q или p*(1 p). Отсюда взялась формула:

Разновидности и откуда они взялись (2) 2. Где взять генеральное СКО? σ – это, вообще-то, генеральное СКО, которое вам в задаче фиг дадут. Есть выход – выборочная дисперсия S 2 , которая, как всем известно, смещена. Поэтому оцениваем генеральную так: (чтобы и не думала смещаться), и подставляем. А можно сразу так: Но есть такая фишка. Если n>30, разница между S и σ крайне мала ©, поэтому можно схитрить и написать проще:

Разновидности и откуда они взялись (3) «Откуда взялись еще какие-то скобки и энки? ? ? » Есть 2 метода формирования выборки, помним? – повторный и бесповторный. Так вот, все предыдущие формулы годятся для повторной выборки или когда выборка n по отношению к генеральной совокупности N настолько мала, что отношением n/N можно пренебречь. В случае, когда прям принципиально, что выборка бесповторная, или когда в задаче открытым текстом говорится, сколько единиц в генеральной совокупности, обязательно использовать.

Между показателями выборочной совокупности и искомыми показателями (параметрами) генеральной совокупности, как правило, существуют некоторые разногласия, которые называют ошибками выборки. Общая ошибка выборочной характеристики состоит из ошибок двух родов: ошибки регистрации и ошибки репрезентативности.

Ошибки регистрации свойственны любому статистическому наблюдению и появление их может быть вызвано невнимательностью регистратора, неточностью подсчетов, несовершенством измерительных приборов и т.д.

Ошибки репрезентативности присущи только выборочному наблюдению и обусловлены самой его природой поскольку как бы тщательно и правильно не проводился отбор единиц средние и относительные показатели выборочной совокупности всегда будут в какой-то степени отличаться от соответствующих показателей генеральной совокупности.

Различают систематические и случайные ошибки репрезентативности. Систематические ошибки репрезентативности - это неточности, которые возникают вследствие несоблюдения условий отбора единиц в выборочную совокупность, не предоставление равной возможности каждой единице генеральной совокупности попасть в выборку. Случайные ошибки репрезентативности - это погрешности, которые возникают вследствие того, что выборочная совокупность точно не воспроизводит характеристики генеральной совокупности (среднее, долю, дисперсию и др.) в силу несплошного характера обследования.

При соблюдении принципа случайного отбора размер ошибки выборки прежде всего зависит от численности выборки. Чем больше численность выборки при прочих равных условиях, тем меньше величина ошибки выборки. При большой численности выборки отчетливее проявляется действие закона больших чисел, согласно которому: с вероятностью, сколь угодно близкой к единице, можно утверждать, что при достаточно большом объеме выборки и ограниченной дисперсии выборочные характеристики (средняя доля) будут сколь угодно мало отличаться от соответствующих генеральных характеристик.

Размеры ошибки выборки также непосредственно связаны со степенью варьирования изучаемого признака, а степень варьирования, как отмечалось выше, в статистике характеризуется размером дисперсии (рассеяния): чем меньше дисперсия, тем меньше ошибка выборки, тем более надежные статистические выводы. Поэтому на практике дисперсию отождествляют с ошибкой выборки.

Поскольку параметр генеральной совокупности есть искомая величина и он неизвестен, нужно ориентироваться не на конкретную ошибку, а среднюю из всех возможных выборок.

Если из генеральной совокупности отобрать несколько выборочных совокупностей, то каждая из полученных выборок даст разное значение конкретной ошибки.

Средняя квадратическая величина /и исчисленная из всех возможных значений конкретных ошибок (;) составит:

где *и - выборочные средние; х - генеральная средняя;)] - численность выборок по величине є1 = ~си - х.

Среднее квадратическое отклонение выборочных средних от генеральной средней называют средней ошибкой выборки.

Зависимость величины ошибки выборки от ее численности и от степени варьирования признака находит выражение в формуле средней ошибки выборки /и.

Квадрат средней ошибки (дисперсия выборочных средних) прямо пропорционален дисперсии Сто и обратно пропорционален численности выборки п:

где - дисперсия признака в генеральной совокупности.

Отсюда среднюю ошибку в общем виде определяют по формуле:

Итак, определив по выборке среднее квадратичное отклонение, можно установить значение средней ошибки выборки, величина которой, как следует из формулы, тем больше, чем больше вариация случайной величины и тем меньше, чем больше численность выборки.

Поэтому по мере роста объема выборки размер средней ошибки уменьшается. Если, например, нужно уменьшить среднюю ошибку выборки в два раза, то численность выборки следует увеличить в четыре раза, если надо уменьшить ошибку выборки в три раза, то объем выборки следует увеличить в девять раз и т. д.

В практических расчетах применяются две формулы средней ошибки выборки для средней и для доли.

При выборочном изучении средних показателей формула средней ошибки такая:

При изучении относительных показателей (частных признаков) формула средней ошибки имеет вид:

где г - доля признака в генеральной совокупности.

Применение приведенных формул средней ошибки предполагает, что известны генеральная дисперсия и генеральная доля. Однако в действительности эти показатели неизвестны и вычислить их невозможно из-за отсутствия данных относительно генеральной совокупности. Поэтому возникает потребность замены генеральной дисперсии и генеральной доли другими, близкими к ним, величинами.

В математической статистике доказано, что такими величинами могут быть выборочная дисперсия(ст) и выборочная доля (со).

С учетом сказанного формулы средней ошибки могут быть записаны так:

Эти формулы дают возможность определить среднюю ошибку при повторной выборке. Применения простой случайной повторной выборки в практике является ограниченным. Прежде всего практически нецелесообразно, а иногда невозможно повторное обследование тех же единиц. Применение бесповторного отбора вместо повторного диктуется также требованием повышения степени точности и надежности выборки. Поэтому на практике чаще используют способ бесповторного случайного отбора. По этому способу отбора единица совокупности, отобранная в выборку, в дальнейшем отборе не участвует. Единицы отбирают из генеральной совокупности, уменьшенной на количество ранее отобранных единиц. Поэтому в связи с изменением численности генеральной совокупности после каждого отбора и вероятности отбора для единиц, что остались, в формулы средней ошибки выборки вводится поправочный множитель

где N - численность генеральной совокупности; п - численность выборки. При достаточно большом значении N можно единицей в знаменателе пренебречь. Тогда

Следовательно, формулы средней ошибки выборки для бесповторного отбора для средней и для доли соответственно имеют вид:

Поскольку п всегда меньше М, то дополнительный множитель всегда меньше единицы. Следовательно, абсолютное значение ошибки выборки при бесповторном отборе всегда будет меньше, чем при повторном.

Если численность выборки достаточно велика, то величина 1 ^ близка к единице, а потому ею можно пренебречь. Тогда среднюю ошибку случайного бесповторного отбора определяют по формуле собственно-случайной повторной выборки.

Рассчитаем для нашего примера среднюю ошибку для урожайности и доли участков с урожайностью 25 ц/га и более.

Средняя ошибка выборки

а) средней урожайности ячменя

Средняя урожайность ячменя в генеральной совокупности х -Г^ = 25,1 ± 0,12 ц/га, то есть находится в пределах от 24,98 до 25,22 ц/га.

Доля участков с урожайностью 25 ц/га и более в генеральной совокупности р

Т-^Г = 0,80 ± 0,07, т.е. находится в пределах от 73 до 87%.

Средняя ошибка выборки показывает возможные отклонения характеристик выборочной совокупности от характеристик генеральной совокупности. Вместе с тем при проведении выборочного наблюдения перед исследователями часто стоит задача расчета не только средней ошибки, но и определение предельной возможной ошибки выборки. Зная среднюю ошибку, можно определить границы, за которые не выйдет величина ошибки выборки. Однако утверждать, что эти отклонения не превысят заданной величины, можно не с абсолютной достоверностью, а лишь с определенной степенью вероятности. Уровень вероятности, что принимается при определении возможных пределов, в которых содержатся значения параметров генеральной совокупности, называется доверительным уровнем вероятности.

Доверительная вероятность - это довольно высокая и, такая, что практически считается осуществленной в каждом конкретном случае, вероятность, что гарантирует получение надежных статистических выводов. Обозначим ее через Г а вероятность превысить этот уровень - а. Итак, а =1 - Р Вероятность а называют уровнем значимости (существенности), который характеризует относительное число ошибочных выводов в общем числе выводов и определяется как разница между единицей и доверительной вероятностью, что принимается.

Уровень доверительной вероятности устанавливает исследователь исходя из степени ответственности и характера задач, которые решаются. В статистических исследованиях в экономике чаще всего принимается уровень доверительной вероятности Г = 0,95; Р = 0,99 (соответственно уровень значимости а = 0,05; а = 0,01) реже Г = 0,999. Например, доверительная вероятность Г = 0,99 означает, что ошибка оценки в 99 случаях из 100 не превысит установленной величины и только в одном случае из 100 может достичь вычисленного значения, или превысить его.

Ошибка выборки, исчисленная с заданной степенью надежной вероятности, называется предельной ошибкой выборки Ер.

Рассмотрим, как устанавливается величина возможной предельной ошибки выборки. Величина ер связана с нормированным отклонением и, которое определяется как отношение предельной ошибки выборки ер к средней ошибки и:

Для удобства расчетов отклонения случайной величины от ее среднего значения обычно выражают в единицах среднего квадратического отклонения. Выражение

называют нормированным отклонением. в В статистической литературе и называют коэффициентом доверия, или коэффициентом кратности средней ошибки выборки.

Так, нормированное отклонение выборочной средней можно определить по формуле:

и _є_р_

Из выражения 1 можно найти возможную предельную ошибку выборки

ер = и/л.

Подставив вместо г. в ее значение, приведем формулы предельных ошибок выборки для средней и для доли при бесповторном случайном отборе:

Следовательно, предельная ошибка выборки зависит от величины средней ошибки и нормированного отклонения и равна ± кратному числу средних ошибок выборки.

Средняя и предельная ошибки выборки - именованные величины и выражаются в тех же единицах, что и средняя арифметическая и среднее квадратическое отклонения.

Нормированное отклонение функционально связано с вероятностью. Для нахождения значений и составлены специальные таблицы (доб.2), по которым можно найти значение и при заданном уровне доверительной вероятности и значения вероятности при известном и.

Приведем значения и и соответствующие им вероятности для выборок с численностью п > 30, что чаще всего используется в практических расчетах:

Следовательно, при и = 1 вероятность отклонения выборочных характеристик от генеральных на величину однократной средней ошибки выборки равна 0,6827. Это означает, что в среднем с каждой 1000 выборок 683 дадут обобщенные характеристики, которые будут отличаться от генеральных обобщенных характеристик не более, чем на величину однократной средней ошибки. При и = 2 вероятность равна 0,9545. в Это означает, что с каждого 1000 выборок 954 дадут обобщенные характеристики, которые будут отличаться от генеральных обобщенных характеристик не более чем на двукратную среднюю ошибку выборки и т.д.

Однако в связи с тем, что, как правило, проводится только одна выборка, то мы говорим, что, например, с вероятностью 0,9545 можно гарантировать, что размеры предельной ошибки не превысят двукратную среднюю ошибку выборки.

Математически доказано, что отношение ошибки выборки к средней ошибки, как правило, не превышает ± 3д при достаточно большой численности п, несмотря на то, что ошибка выборки может приобретать любые значения. Другими словами можно сказать, что при достаточно высокой вероятности суждения (Р = 0,9973) предельная ошибка выборки, как правило, не превышает трех средних ошибок выборки. Поэтому величину Ер = 3д можно принять за предел возможной ошибки выборки.

Определим для нашего примера предельную ошибку выборки для средней урожайности и доли участков с урожайностью 25 ц/га и более. Доверительный уровень вероятности примем равным Р = 0,9545. в По таблице (прил .2) найдем значения и = 2. Средние ошибки выборки для урожайности и доли участков с урожайностью 25 ц/га и больше были найдены ранее и соответственно составляли: Ц~ = ±0,12 ц/га; МР = ± 0,07.

Предельная ошибка средней урожайности ячменя:

Итак, разница между выборочной средней урожайностью и генеральной средней будет не больше 0,24 ц/га. Пределы средней урожайности в генеральной совокупности: х = х ±есть~ = 25,1 + 0,24, то есть от 24,86 до 25,34 ц/га.

Предельная ошибка доли участков с урожайностью 25 ц/га и более:

Следовательно, предельная ошибка в определении доли участков с урожайностью 25 ц/га и больше не превысит 14%, то есть удельный вес участков с указанной урожайностью в генеральной совокупности находится в пределах: г = а> ± ер = 0,80 ± 0,14, то есть от 66 до 94%.

Ошибки выборки. Задачи, решаемые при применении выборочного наблюдения. Средняя ошибка выборки

Определение необходимого объема повторной и бесповтор­ной выборок при оценке генеральной средней и доли.

Статистическая гипотеза и статистический критерий. Ошибки 1-го и 2-го рода. Уровень значимости и мощность критерия. Принцип практической уверенности.

Определение необходимого объема повторной и бесповторной выборок при оценке генеральной средней и доли.