🚫 Копирование и вставка текста отключены
СПб МСИ
САНКТ-ПЕТЕРБУРГСКИЙ
МЕДИКО-СОЦИАЛЬНЫЙ ИНСТИТУТ
Кафедра естественно-научных дисциплин им. профессора А.Г. Шлейкина

Практическое занятие №1
«Первичная статистическая обработка данных медицинского эксперимента и проверка гипотезы о нормальности распределения (критерий Пирсона)»

Информационные технологии в медицине · 1 курс

САНКТ-ПЕТЕРБУРГСКИЙ МЕДИКО-СОЦИАЛЬНЫЙ ИНСТИТУТ
Кафедра естественно-научных дисциплин им. профессора А.Г. Шлейкина · дисциплина «Информационные технологии в медицине»

Работа №1. Статистическая обработка данных и критерий Пирсона

Вариант —
Прогресс выполнения0 / 0
📋 Как устроено занятие — прочитайте один раз, дальше вопросов не будет
  1. Что понадобится: Excel (или LibreOffice Calc / «Google Таблицы») и эта страница. Считаете вы в таблице, а сюда вписываете результаты — страница сразу проверяет их и говорит, где ошибка.
  2. Работа идёт по вашей выборке — 30 значений одного показателя, они в блоке 0 сразу под этой памяткой. Перенесите их в Excel в ячейки A1:A30 и дальше работайте с ними.
  3. Порядок такой: блок 1 — описательная статистика и гистограмма; блок 2 — проверка нормальности распределения критерием χ² Пирсона (он использует числа из блока 1, поэтому открывается после его проверки); затем два вывода — математический и медицинский.
  4. Вставка текста в поля отключена — числа из Excel вписывайте руками. Это быстро и заодно заставляет посмотреть на каждое значение.
  5. Поля со звёздочкой обязательны для сдачи. Кнопка «🔍 Проверить перед сдачей» внизу покажет, чего не хватает, ничего не отправляя.
  6. Ответы сохраняются сами (отметка в шапке). Закончили — кнопка «✅ Сдать работу» внизу страницы.
0
Ваш вариант и исходные данные
Вам присвоен один из 30 вариантов задания. Каждому варианту соответствует один из 14 параметров медицинского эксперимента (выборка значений у 30 пациентов, Таблица №2 приложения к работе №1); при численности группы более 14 человек варианты повторяются по параметрам, но остаются индивидуальными по номеру. Перенесите указанную ниже выборку в отчёт и в ячейки A1:A30 таблицы Excel.

1
Часть 1. Первичная статистическая обработка
📌 Шаг 1.1. Описательная статистика в Excel
Что сделать: перенести свою выборку в Excel (A1:A30), включить надстройку «Анализ данных», получить сводку по выборке и переписать девять значений в поля ниже.
Excel 2010/2013: Файл → Параметры → Надстройки → Управление надстройками Microsoft Office → «Надстройки Excel» → Перейти → отметить «Пакет анализа» → ОК. Затем: Данные → Анализ данных → Описательная статистика. Входной интервал: A1:A30. Отметить «Итоговая статистика».

Если для вашего варианта в столбце «Мода» Excel выдал ошибку #Н/Д — это не ошибка ввода, а нормальный результат: мода существует, только если хотя бы одно значение в выборке повторяется; если все 30 значений уникальны, моды не существует. В этом случае впишите в поле «Мода» ниже число 0 (условный признак «моды нет») и укажите это в выводе.

Впишите значения, полученные в Excel (среднее, стандартная ошибка, медиана, мода, стандартное отклонение, асимметрия, эксцесс, минимум, максимум):
Если надстройки «Анализ данных» нет (LibreOffice, «Google Таблицы», урезанная сборка Excel) — те же величины считаются обычными формулами по диапазону A1:A30: =СРЗНАЧ(), =МЕДИАНА(), =МОДА.ОДН(), =СТАНДОТКЛОН.В(), =СКОС(), =ЭКСЦЕСС(), =МИН(), =МАКС(); стандартная ошибка — =СТАНДОТКЛОН.В(A1:A30)/КОРЕНЬ(30).










Заполните все поля, чтобы стала доступна проверка.
📌 Шаг 1.2. Гистограмма распределения
Что сделать: сначала построить гистограмму автоматически (Excel сам выберет карманы), затем посчитать границы шести карманов по формуле и заполнить таблицу ниже — границы и частоты.
2а. Сначала — автоматически. Данные → Анализ данных → Гистограмма. Входной интервал: A1:A30. Оставьте поле «Интервал карманов» пустым — Excel сам предложит границы и построит график. Посмотрите на результат, запомните или сохраните его (пригодится для сравнения на Шаге 3).

2б. Теперь — самостоятельно, по формуле. По правилу Стёрджеса для n=30 число карманов h=6 (уже дано, считать не нужно). Дальше карманы равной ширины, и верхнюю границу каждого из них рассчитайте сами по формуле:
Границаi = Xmin + i × (Xmax − Xmin) / 6,  i = 1, 2, 3, 4, 5, 6 где Xmin и Xmax — минимум и максимум, которые вы уже нашли на шаге 1.1 (граница 6-го кармана всегда равна Xmax). Впишите все 6 границ, затем — частоту (fэ) попадания значений выборки в каждый карман.
Частоты (fэ) — сколько значений выборки попало в каждый карман. Их можно взять из автоматической гистограммы (пункт 2а) или посчитать в Excel: для первого кармана =СЧЁТЕСЛИ(A1:A30;"<="&граница1), для остальных — =СЧЁТЕСЛИМН(A1:A30;">"&предыдущая;A1:A30;"<="&текущая). Сумма всех шести частот должна быть 30.
Заполните границы и частоты во всех карманах, чтобы стала доступна проверка.
📌 Шаг 1.3. Сравнение двух гистограмм и вывод о форме распределения
Что сделать: сравнить карманы, которые предложил Excel, со своими, и описать, на что похожа форма распределения (симметричная, скошенная, с «хвостом»).
2
Часть 2. Проверка гипотезы о нормальности (критерий Пирсона χ²)
Критерий согласия Пирсона χ² сравнивает эмпирическое распределение (Ваша гистограмма) с теоретическим нормальным распределением N(x̄, σ). Функция Excel: НОРМ.РАСП(xᵢ; x̄; σ; ИСТИНА) — интегральная функция распределения в точке xᵢ.
📌 Шаг 2.1. Расчётная таблица критерия χ²
Что сделать: досчитать в Excel четыре столбца таблицы по формулам ниже и вписать результаты. Первые два столбца (xᵢ и fэ) уже заполнены вашими числами из блока 1.
Столбцы xᵢ и fэ уже перенесены из ваших Шагов 1–2 (Часть 1). Остальные четыре столбца рассчитайте сами в Excel по формулам ниже и впишите результат в таблицу (x̄, σ — среднее и стандартное отклонение вашей выборки из Шага 1; n = 30):
  • НОРМ.РАСП(xᵢ) — значение функции нормального распределения в точке xᵢ: =НОРМ.РАСП(xᵢ; x̄; σ; ИСТИНА)
  • pᵢ — вероятность попадания в карман: для 1-го кармана pᵢ = НОРМ.РАСП(x₁); для остальных pᵢ = НОРМ.РАСП(xᵢ) − НОРМ.РАСП(xᵢ₋₁)
  • — теоретическая частота: fт = n × pᵢ
  • (fэ−fт)²/fт — вклад кармана в χ²; χ²э — сумма этого столбца по всем карманам
Показать пример расчётной таблицы с формулами Excel (наведите на логику — сами числа зависят от вашего варианта)
xᵢНОРМ.РАСП.(xᵢ)pᵢfт=n·pᵢ(fэ−fт)²/fт
D2E2=НОРМ.РАСП(D2;$B$1;$B$2;ИСТИНА)=F2=G2*30=(E2−H2)^2/H2
D3E3=НОРМ.РАСП(D3;$B$1;$B$2;ИСТИНА)=F3−F2=G3*30=(E3−H3)^2/H3
… (та же формула вниз)=F(n)−F(n−1)… (та же формула вниз)… (та же формула вниз)

Здесь D — столбец с границами карманов (xᵢ), E — с частотами (fэ), F–I — столбцы, которые вы считаете сами; $B$1 и $B$2 — ячейки со средним и стандартным отклонением вашей выборки (со знаком $, чтобы при протягивании формулы вниз ссылка на них не сдвигалась). pᵢ для первого кармана — это просто НОРМ.РАСП(x₁), так как «нижней границей» первого кармана условно считается −∞, для которой функция распределения равна 0.

Таблица откроется после того, как вы заполните и проверите описательную статистику и гистограмму в блоке 1: расчёт χ² берёт оттуда среднее, стандартное отклонение, границы карманов и частоты.

Эмпирическое значение χ²э =

📌 Шаг 2.2. Критическое значение χ²кр (таблица в приложении)
Что сделать: выбрать уровень значимости — и посмотреть готовое критическое значение; оно понадобится для сравнения на следующем шаге.

Число степеней свободы k = h − 3, где h — число карманов (h = 6, значит k = 3).
Не путайте с n: буквой n в формуле теоретической частоты обозначен объём выборки, n = 30. Степеней свободы здесь три.

χ²кр = 7,815
Показать полную таблицу критических точек распределения χ² (приложение к работе №1)
📌 Шаг 2.3. Сравнение и вывод о нормальности
Что сделать: нажать «Сравнить», посмотреть, какое из двух чисел больше, и записать вывод своими словами.
Правило решения: если χ²э < χ²кр — расхождение с нормальным распределением объяснимо случайностью выборки, гипотеза о нормальности не отвергается. Если χ²э ≥ χ²кр — распределение значимо отличается от нормального.
Насколько этому выводу можно верить: условие применимости критерия

У критерия Пирсона есть формальное условие: теоретическая частота fт в каждом кармане должна быть не меньше 5. Посмотрите на свой столбец fт — в крайних карманах там почти наверняка стоит число вроде 0,9 или 3,1.

Это не ошибка расчёта и не ошибка в данных. Так получается из-за объёма выборки: при n = 30 и шести карманах на карман приходится в среднем 5 наблюдений, а по краям нормальной кривой — заметно меньше. Ни один из 30 вариантов этой работы условию fт ≥ 5 во всех карманах не удовлетворяет, и это честнее сказать, чем умолчать.

Что это значит для вашего вывода. Значение χ²э посчитано правильно, но при малых fт распределение статистики хуже приближается к табличному χ², поэтому вывод здесь — ориентировочный, учебный. Он показывает, умеете ли вы провести проверку, а не доказывает нормальность показателя.

Как поступают в реальном исследовании. Есть три обычных пути: (1) объединить крайние карманы с соседними, пока fт не станет ≥ 5 — здесь после такого объединения осталось бы 3–4 кармана, и число степеней свободы пришлось бы пересчитать; (2) набрать больше наблюдений — для шести карманов комфортно уже n ≈ 60–100; (3) взять критерий, рассчитанный на малые выборки, — при n < 50 нормальность обычно проверяют критерием Шапиро — Уилка, именно его по умолчанию считают статистические пакеты и ждут рецензенты медицинских журналов.

Если напишете об этом в математическом выводе своими словами — это плюс, а не придирка к заданию.

Выводы по работе
📌 Математический вывод
Опишите характер закона распределения в Вашей выборке, опираясь на форму гистограммы, показатели описательной статистики (асимметрию, эксцесс) и результат критерия χ² Пирсона: подтвердилась ли гипотеза о нормальности распределения и почему.
📌 Медицинский вывод
Расскажите о своих пациентах (выборке) как лечащий врач: что означает полученное среднее значение и разброс показателя для этой группы больных, есть ли пациенты с отклонениями от нормы, на что это может указывать клинически.
🤔 В чём вы не уверены?
Назовите то, что осталось непонятным или вызывает сомнение: шаг расчёта, выбор метода, трактовка результата. Сказать «вот здесь я не уверен» — часть работы исследователя, а не признак слабости: именно из таких мест растёт понимание. Если всё ясно — напишите, какой вопрос вы задали бы преподавателю по этой теме.
📋
Критерии оценки за практическую часть (Части 1–2 и выводы)
КритерийБаллыОписание
Математико-статистическая часть — оценка 0–5
Первичная обработка2Верно рассчитаны показатели описательной статистики, корректно построена гистограмма
Критерий Пирсона2Правильно вычислен χ², верно определено число степеней свободы
Математический вывод1Вывод соответствует полученным числам, названы использованные критерии
Медицинская часть — оценка 0–5
Интерпретация результатов3Результаты расчётов осмысленно истолкованы применительно к обследованным пациентам
Полнота врачебного заключения2Указано, что означает вывод о нормальности распределения для дальнейшего анализа данных
Таблица показывает, из чего складывается каждая из двух оценок, которые преподаватель выставляет по балльно-рейтинговой шкале (0, 2, 3, 4 или 5 баллов за каждую часть). Это не автоматический подсчёт: преподаватель оценивает работу целиком, а таблица служит ориентиром, что именно учитывается в каждой части.
3
Оценка и сдача работы
Итоговая оценка складывается из двух частей, которые выставляет преподаватель по балльно-рейтинговой шкале — 0, 2, 3, 4 или 5 баллов за каждую часть (это рейтинговые баллы, а не школьная отметка «отлично/хорошо/неудовлетворительно»):
математико-статистическая часть — правильность расчётов (описательная статистика, гистограмма, χ²) и математический вывод;
медицинская часть — насколько верно и осмысленно результаты расчётов интерпретированы как врачебное заключение о пациентах.
Обе оценки учитывают и сами расчёты, и текст вывода — не только текст сам по себе.
📋 Как сдать работу: заполните оба вывода выше, затем нажмите «✅ Сдать работу» ниже. Работа автоматически сохраняется на сервере каждые 15 секунд, поэтому можно спокойно продолжать позже — а после сдачи преподаватель увидит её в своём кабинете и сможет проверить и оценить. Кнопка «🖨 Распечатать» ниже — по желанию, для собственного архива.