Представьте: в компании 8 000 сотрудников, нужно провести опрос. Сколько анкет собрать? Интуитивный ответ – «процентов десять, человек восемьсот» – неверен. Достаточно 367 анкет. А теперь удивительное: если бы сотрудников было 100 000 – в двенадцать раз больше, – понадобилось бы всего 383 анкеты. Почти столько же.
Дело в том, что объём выборки растёт не пропорционально генеральной совокупности: с её ростом необходимое число анкет быстро упирается в потолок – 384 человека при стандартных условиях (доверительный уровень 95%, ошибка ±5%). Поэтому опрос завода и опрос целого региона требуют почти одинаковой выборки. Это контринтуитивно – и это первое, что нужно понять про формулу расчёта выборки. Ниже – сама формула, разбор каждого символа, два примера с числами и готовая таблица значений.
Если нужен результат без ручного счёта – онлайн-калькулятор выборки считает по той же формуле: выберите дизайн «Опрос / анкетирование».
Что такое объём выборки простыми словами
Выборка – это те люди, которых вы реально опросили или протестировали. Генеральная совокупность – все, на кого вы хотите распространить вывод: например, «студенты-психологи России» или «учителя начальных классов». Опросить всех невозможно, поэтому берут часть – выборку – и по ней судят о целом.
Объём выборки (его обозначают буквой n) – это сколько именно человек в неё вошло. Не проценты от генеральной совокупности, а конкретное число участников. Именно его требует посчитать научный руководитель, когда спрашивает: «А сколько у вас респондентов и почему столько?»
Здесь и кроется частое заблуждение. Кажется, что чем больше генеральная совокупность, тем больше нужно опросить – «хотя бы процентов десять». На деле объём выборки почти не зависит от её размера: и для факультета в 200 человек, и для целого региона нужное число анкет отличается несильно. Почему так – разберём на формуле ниже.
Чтобы по выборке можно было судить о целом, она должна быть репрезентативной – по составу похожей на генеральную совокупность (пол, возраст, курс). Объём – это только половина дела: 384 случайных человека дадут точную картину, а 384 ваших однокурсника – нет. Как обосновать репрезентативность, разберём отдельно; сейчас – про число.
Формула расчёта выборки Кокрена: базовый вид
Для неограниченной генеральной совокупности формула расчёта объёма выборки выглядит так:
Разберём каждый символ:
- z – z-критерий для выбранного доверительного уровня: 1,96 для 95%, 2,58 для 99%. Доверительный уровень 95% – стандарт для ВКР и большинства опросов;
- p – ожидаемая доля признака в генеральной совокупности. Если она неизвестна, берём 0,5: произведение p·(1 − p) при этом максимально, и расчёт даёт консервативную – наибольшую – выборку;
- e – предельная ошибка в долях: 0,05 для ±5%.
Подставим стандартные значения: z = 1,96, p = 0,5, e = 0,05.
Запомните это число: 384 – эталонный объём выборки для опроса при доверительном уровне 95% и ошибке ±5%. Оно ещё встретится ниже.
Поправка на конечную генеральную совокупность
Если генеральная совокупность известна и невелика, выборку можно уменьшить. Расчёт выборки от генеральной совокупности выполняется поправкой:
Здесь N – объём генеральной совокупности. Когда поправка нужна: N известна и меньше ~20 000. Когда не нужна: N велика или неизвестна – тогда просто n = n₀.
Пример расчёта выборки: пошагово
Пример 1. Опрос сотрудников компании: N = 8 000, доверительный уровень 95%, ошибка ±5%.
- Базовый объём: n₀ = 1,96² · 0,5 · 0,5 / 0,05² = 384;
- Поправка: n = 384 / (1 + 383 / 8 000) = 384 / 1,048 = 367.
Ответ: 367 человек.
Пример 2. Опрос студентов вуза: N = 1 200, доверительный уровень 95%, ошибка ±4%.
- Базовый объём: n₀ = 1,96² · 0,5 · 0,5 / 0,04² = 3,8416 · 0,25 / 0,0016 = 600,25;
- Поправка: n = 600,25 / (1 + 599,25 / 1 200) = 600,25 / 1,499 = 400,3.
Ответ: 401 человек. Промежуточные значения в расчёте не округляем, а дробный итог расчёта численности выборки всегда округляем вверх: лучше опросить на одного человека больше, чем не дотянуть до заявленной точности.
Готовая таблица: объём выборки от генеральной совокупности
Таблица рассчитана для доверительного уровня 95% и p = 0,5 – самый частый случай:
| Генеральная совокупность (N) | Ошибка ±5% | Ошибка ±4% | Ошибка ±3% |
|---|---|---|---|
| 500 | 218 | 273 | 341 |
| 1 000 | 278 | 376 | 517 |
| 2 000 | 323 | 463 | 697 |
| 5 000 | 357 | 536 | 880 |
| 10 000 | 370 | 567 | 965 |
| 50 000 | 382 | 594 | 1 045 |
| 100 000 | 383 | 597 | 1 056 |
| 1 000 000+ | 384 | 601 | 1 067 |
Обратите внимание на столбец ±5%: после N = 50 000 объём выборки практически перестаёт расти и упирается в те самые 384. Это и есть иллюстрация тезиса из начала статьи – размер страны и размер города опрашиваются почти одинаковым числом анкет.
Промежуточные значения N и другие уровни ошибки – в калькуляторе.
Репрезентативность выборки: как её обосновать
Правильный объём – половина дела. Вторая половина – репрезентативность: выборка должна повторять генеральную совокупность по важным признакам. Если вы изучаете тревожность студентов, а опросили только девушек с одного факультета, вывод «о студентах» рецензент не примет – какой бы большой ни была выборка.
Репрезентативную выборку обеспечивает не размер, а способ отбора. Вот что снижает риск смещения:
- Случайный отбор вместо «кто под рукой». Опрос друзей и однокурсников – самая частая причина смещения;
- Совпадение по ключевым характеристикам. Если в генеральной совокупности 60% женщин, примерно столько же должно быть и в выборке (пол, возраст, курс, специальность);
- Понятные критерии включения и исключения – кого берём в исследование, а кого нет, и почему.
В тексте работы репрезентативность обосновывают так: называют генеральную совокупность, описывают способ формирования выборки и показывают, что её состав близок к составу генеральной совокупности. Подробнее о частых ошибках отбора – в статье «Как собрать выборку для психологического исследования».
Ошибка выборки: что это и как посчитать
Ошибка выборки (её ещё называют предельной ошибкой) – это на сколько результат по выборке может отличаться от истинного значения в генеральной совокупности. Та самая ±5% из формулы: если 60% ответили «да» при ошибке ±5%, значит, в реальности доля лежит где-то между 55% и 65%.
Чем меньше ошибку вы закладываете, тем больше нужна выборка – причём связь резкая. Сравните при доверительном уровне 95%:
- ±5% – нужно 384 человека (стандарт для ВКР);
- ±4% – уже 600;
- ±3% – 1 067.
Поэтому в учебной работе по психологии или педагогике ошибку ±5% берут по умолчанию – её достаточно, а ±3% приберегают для дорогих решений (маркетинг, управление). Что такое ошибка выборки в психологии на практике – это честный ответ на вопрос комиссии «насколько вашим цифрам можно верить».
Если генеральная совокупность и объём выборки уже известны, обратную задачу – какая при этом получилась ошибка – быстрее решить в калькуляторе.
Сколько респондентов нужно для ВКР по психологии и педагогике
Самый частый вопрос студента: «Сколько человек хватит?» Точное число даёт расчёт, но есть и рабочие ориентиры, которые принимают на кафедрах психологии и педагогики:
- Бакалаврская ВКР, сравнение групп – обычно от 30 человек в каждой группе. Меньше 30 – и статистические критерии теряют смысл;
- Магистерская диссертация – как правило, 60–100 участников и больше, в зависимости от дизайна;
- Корреляционное исследование – чем больше связей проверяете, тем крупнее выборка; ориентир – от 50–100 человек;
- Факторный анализ – требования жёстче: минимум 5 человек на каждый пункт методики, а лучше 10. Для опросника из 20 пунктов это 100–200 респондентов;
- Опрос с оценкой доли – считается по формуле Кокрена выше (тот самый ориентир 384).
Это ориентиры, а не жёсткое правило. Минимальный объём выборки для ВКР зависит от дизайна и метода анализа: для сравнения групп его считают через мощность, для опроса – по формуле Кокрена. Если руководитель написал, что «выборка маловата», чаще всего проблема не в самом числе, а в том, что оно ничем не обосновано. Как обосновать – ниже.
Когда формула Кокрена не подходит
Формула Кокрена решает одну задачу: оценить долю признака в опросе с заданной точностью. Расчёт необходимого объёма выборки для других дизайнов устроен иначе.
Если вы сравниваете группы (экспериментальная и контрольная), измеряете «до и после» или ищете связь между переменными – объём выборки определяется через априорный анализ мощности: по ожидаемому размеру эффекта, уровню значимости α и статистической мощности. Это другой расчёт – его выполняют дизайны «Сравниваю 2 группы», «До и после» и «Ищу связь» в нашем калькуляторе или программа G*Power.
Такой расчёт называют априорным анализом мощности. На входе – три величины: ожидаемый размер эффекта (для сравнения групп это d Коэна: 0,2 – маленький, 0,5 – средний, 0,8 – большой), уровень значимости α (обычно 0,05) и мощность (обычно 0,80). На выходе – сколько человек нужно, чтобы эффект такого размера не «спрятался» в случайном разбросе. Классический инструмент для этого – бесплатная программа G*Power; те же расчёты без установки делает наш онлайн-калькулятор.
Обосновать выборку эксперимента формулой Кокрена. Рецензент это видит: формула для опросов не отвечает на вопрос, сколько человек нужно, чтобы обнаружить различия между группами.
Как рассчитать выборку онлайн
Считать вручную не обязательно. Наш калькулятор размера выборки закрывает оба случая: для опроса он использует формулу Кокрена с поправкой на генеральную совокупность, а для эксперимента, дизайна «до/после» и поиска связи – априорный анализ мощности, как в G*Power. Нужно выбрать тип исследования и ввести исходные данные: объём генеральной совокупности, доверительный уровень и ошибку либо ожидаемый размер эффекта.
Результат калькулятора можно сразу вставить в текст работы – он показывает не только число, но и параметры расчёта. Это и есть то обоснование объёма выборки, которого ждёт научный руководитель.