Поясни за мед

Поясни за мед

Математическая статистика, что за монстр?

Что такое математическая статистика? Её считают разделом математики. Она изучает методы сбора и обработки статистической информации для какой-либо пользы. С помощью статистики можно понять, эффективно мы лечим пациентов или нет, сколько подохло больных от того или иного заболевания и так далее. Давай сразу пример, чтобы ты понял немного суть математической статистики.

Было отобрано 10 больных с ОРВИ. Будем считать, что все они заболели в одну и ту же секунду. Мы начали считать: через сколько часов у каждого больного прекратились симптомы заболевания. Получили такие данные:

Больной12345678910
Время выздоровления65ч77ч63ч76ч56ч61ч69ч79ч65ч67ч

Мы получили данные из этого опыта. Это первичные статистические данные, потому что мы с ними ещё ничего не делали, а просто получили из опыта (эмпирическим путем).

Все полученные значения отличаются и эти числа, например 65 часов, 77 часов и так далее, называются вариантами. А их вся совокупность (все значения, которые мы получили в опыте) называются вариационным рядом.

В статистике, как и в математике, принято все выражать через буквы, поэтому, например, пациентов можно «выразить», как иксы, а время их выздоровления, через букву «тэ». Получится что-то типа такого:

𝑥𝑛𝑥1𝑥2𝑥3𝑥4𝑥5𝑥6𝑥7𝑥8𝑥9𝑥10
𝑡𝑛𝑡1 = 65𝑡2 = 77𝑡3 = 63𝑡4 = 76𝑡5 = 56𝑡6 = 61𝑡7 = 69𝑡8 = 79𝑡9 = 65𝑡10 = 67

Что дальше мы сможем сделать с этой таблицей статистических данных? Правильно! Обрабатывать! Для начала можно найти среднюю арифметическую, чтобы понять, за сколько в среднем проходит болезнь. Чтобы показать среднюю арифметическую, достаточно поставить черточку над буквой «тэ» в данном случае. То есть вот так:

То есть по нашим данным, средняя продолжительность болезни составляет 67.8 часов. По-другому это значение называют простым средним. Но насколько эти цифры достоверны? Мы взяли всего лишь 10 пациентов, поэтому о достоверности результата точно нельзя сказать. То есть чем больше взять людей/провести опытов, тем достовернее будет результат.

Другой пример. 120 студентов были на экзамене по анатомии. 17 из них не сдало (получили 2), 44 получили «уд» (тройбан), 30 получили «хор» (четверка) и остальные сдали на «отл» (пятерка). Требуется вычислить среднюю успеваемость студентов по анату.

Для начала составим табличку:

«неуд» (2)«уд» (3)«хор» (4)«отл» (5)
17443029

Математический вариант таблицы будет выглядеть примерно так:

𝑥𝑛𝑥1 = 2𝑥2 = 3𝑥3 = 4𝑥4 = 5
𝑁𝑛𝑁1 = 17𝑁2 = 44𝑁3 = 30𝑁4 = 29

Здесь данные немного другие. Тут на каждую оценку (икс) приходит количество студентов (буква «эн»), на которые они и сдали анатомию. Иначе говоря, на каждый вариант (оценка) приходит своя частота (количество студентов). Как ты понял, надо запомнить термины «вариант» и «частота».

Общее количество студентов это множество, которое мы исследуем и это называется статистической совокупностью. Каждый студент – это элемент статистической совокупности. Количество всех элементов называется объемом совокупности.

Теперь говоря «математико-статистическим» языком: мы исследуем статистическую совокупность объемом 120 элементов. Даны 4 варианта с частотами 17, 44, 30 и 29 соответственно.

Так-с, нам надо найти среднюю успеваемость студентов. Под средней успеваемостью тут имеется в виду оценки (то есть икс). Это почти как средняя арифметическая, но называется она средневзвешенной. Вычисляем так:

То есть мы сначала умножаем каждый вариант 𝑥𝑛 на его частоту 𝑁𝑛, все это складываем и делим на общее количество элементов (студентов в данном случае). Так мы получаем средневзвешенную. Итого средняя успеваемость студентов по анату: 3.59. Чёт плохо занимались медициной они. Пишу приказ об отчислении.

Теперь более масштабно. Перед нами стоит задача определить среднюю частоту сердечных сокращений (ЧСС) у россиянина. Число россиян в РФ примерно 140 лямов. Но мы чисто физически не сможем измерить у стольких людей, времени и сил не хватит. Поэтому мы должны отобрать какое-то количество людей и у них измерить. То есть сузить количество исследовании с 140 миллионов до 500, например.

А теперь к терминологии. В данном случае все граждане РФ (140 лямов) будет генеральной совокупностью. А те 500 человек, которые мы решили проверить – будут выборкой. То есть выборка – это часть генеральной совокупности, и желательно, чтобы эта выборка «характеризовала» генеральную совокупностью. То есть, чтобы выборка показывала очень хорошо среднее значение генеральной совокупности, максимально близко отражала генеральную совокупность. Это называется репрезентативность выборки. Немного трудно объяснить это, давай на примере лучше:

Смотри, мы провели опыт с этими 500 людьми и получили выборочную среднюю ЧСС 76 ударов в минуту. А если измерили бы все 140 лямов, то получили бы генеральную среднюю 78 ударов в минуту. То есть разница не большая, поэтому выборка репрезентативна, а если бы мы получили так, что у выборки ЧСС 50, а у генеральной совокупности ЧСС 80 – тогда выборка НЕ репрезентативна. Надеюсь, стало понятней.

Чтобы выборка была репрезентативной надо правило её делать😊 Надо учитывать многие факторы (например, возраст, болезни, стресс при исследовании и прочее). Метод выбирания так, чтобы выборка была репрезентативной, называется выборочный метод (КЭП!).

Все элементы (каждый человек при измерении ЧСС) выборки будут называться выборочной совокупностью. И, по аналогии, 500 человек – это объем выборочной совокупности.

А чтобы уже, наконец-то, вычислить среднюю ЧСС, применяем обычную формулу средней арифметической:

Где, 𝑛 = 500, наша выборка, а «иксики» — ЧСС каждого человека. При таких огромных вычислениях лучше не писать это все вручную, конечно же. Самый оптимальный вариант – использовать таблицы Excel.

Если ты первую главу освоил, то дальше понимать будет легче, так что бегом к следующей главе!