Логистическая регрессия — это алгоритм контролируемого машинного обучения для задач классификации. Он оценивает вероятность принадлежности объекта к классу, например поможет определить, одобрят заявку или нет, является письмо спамом или нет.
Несмотря на слово «регрессия» в названии, метод чаще используют именно для классификации. Он важен и в машинном обучении, и в прикладной статистике, потому что даёт понятную интерпретацию результата через вероятности, коэффициенты и отношение шансов.
Содержание статьи
Чем логистическая регрессия отличается от линейной
Главное различие простое: линейная регрессия предсказывает числовое значение, а логистическая регрессия предсказывает вероятность класса. Если нужно оценить непрерывный показатель, подходит линейная модель; если нужен ответ вида «да или нет», чаще выбирают логистическую.
Линейная регрессия пытается провести прямую зависимость между признаками и итогом. Например, по доходу, накоплениям или стажу можно предсказывать числовой кредитный рейтинг. Выход такой модели не ограничен: он может быть очень маленьким, очень большим или даже отрицательным.
С вероятностями это не работает. Вероятность должна лежать в диапазоне от 0 до 1. Поэтому в логистической регрессии линейная комбинация признаков проходит через специальное преобразование, которое сжимает результат до допустимого интервала.
На практике это выглядит так: модель считает вероятность положительного исхода, а затем сравнивает её с порогом. Часто используют 0,5, но конкретное значение зависит от задачи. Если вероятность выше порога, объект относят к одному классу, если ниже — к другому.
У двух подходов есть и общее. Оба анализируют связь между признаками и целевой переменной, оба используют коэффициенты и оба требуют проверки качества модели. Но интерпретация результата у них разная.
Как работает логистическая регрессия
Логистическая регрессия строит линейную комбинацию признаков, а затем переводит её в вероятность с помощью сигмоидной функции. За счёт этого модель выдаёт значение строго между 0 и 1.
Если записать идею без лишней математики, модель сначала считает взвешенную сумму признаков. Каждый признак влияет на итог через свой коэффициент. Затем эта сумма проходит через сигмоиду — S-образную функцию, которая превращает любое число в вероятность.
Именно поэтому логистическая регрессия остаётся линейной моделью по своей основе, хотя на выходе мы видим не прямую линию, а плавную кривую. Внутри есть линейная часть. Ограничение по диапазону появляется уже после преобразования.
Сигмоида удобна по двум причинам:
- преобразует любое значение в число от 0 до 1;
- позволяет трактовать результат как вероятность;
- подходит для бинарной классификации, где есть два исхода.
Если модель оценила вероятность одобрения заявки как 0,82, это означает, что по признакам объект ближе к классу «одобрить». Дальше остаётся решить, какой порог использовать для окончательной классификации.
Почему модель работает через шансы и логарифм шансов
Логистическая регрессия напрямую моделирует не саму вероятность, а логарифм отношения шансов. Такой подход позволяет связать вероятностный результат с линейной формулой.
Вероятность и шансы — не одно и то же. Вероятность показывает долю благоприятных исходов среди всех возможных. Шансы сравнивают вероятность события с вероятностью того, что событие не произойдёт.
Если вероятность события равна 0,5, шансы равны 1. Это означает равновесие: исход «да» столь же вероятен, как исход «нет». Если вероятность растёт, шансы становятся больше 1. Если падает — меньше 1.
Проблема в том, что шансы лежат в диапазоне от 0 до бесконечности и распределены несимметрично. Поэтому берут логарифм шансов. После этого значения уже могут быть любыми — от отрицательных до положительных, и с ними удобно работать линейной модели.
В логистической регрессии предполагается, что именно логарифм шансов линейно зависит от признаков. А потом через обратное преобразование получается вероятность класса.
Что такое шансы
Шансы — это отношение вероятности события к вероятности его отсутствия. Они помогают описывать изменение вероятности в форме, которая лучше подходит для математической модели.
Если шанс больше 1, событие скорее произойдёт. Если меньше 1, скорее не произойдёт. Если равен 1, оба исхода равновероятны.
Что такое логарифм шансов
Логарифм шансов, или log-odds, — это логарифм от отношения шансов. Именно эта величина в логистической регрессии выражается как сумма коэффициентов и признаков.
Такое представление удобно: линейная часть модели может принимать любые значения, а затем через сигмоиду они переводятся обратно в вероятность. За счёт этого сохраняется и математическая корректность, и интерпретируемость.
Что такое отношение шансов
Отношение шансов показывает, как меняются шансы события при увеличении признака на одну единицу. Это один из самых полезных инструментов для интерпретации коэффициентов логистической регрессии.
Если после экспоненцирования коэффициента получается значение больше 1, рост признака увеличивает шансы положительного исхода. Если меньше 1 — уменьшает. Если равно 1, заметного влияния нет.
Как интерпретировать коэффициенты логистической регрессии
Коэффициенты логистической регрессии показывают, как признаки влияют на логарифм шансов целевого события. Напрямую трактовать их как прирост вероятности нельзя.
Это важный момент. В линейной регрессии можно сказать: при росте признака на единицу целевая переменная увеличивается на конкретную величину. В логистической регрессии так говорить нельзя, потому что связь проходит через нелинейное преобразование.
Зато можно уверенно сказать другое. Знак коэффициента показывает направление влияния:
- положительный коэффициент повышает вероятность положительного класса;
- отрицательный коэффициент снижает её;
- нулевой коэффициент означает отсутствие влияния признака.
Сила влияния зависит от величины коэффициента, но интерпретировать её удобнее через отношение шансов. Именно поэтому в прикладных задачах часто смотрят не только на знак коэффициента, но и на его экспоненту.
Есть ещё один нюанс. Один и тот же прирост признака влияет на вероятность по-разному в разных точках шкалы. Когда вероятность уже близка к 0 или 1, изменение может быть слабее, чем в середине диапазона.
Непрерывные признаки
Для непрерывного признака коэффициент показывает, как меняется логарифм шансов при увеличении этого признака на одну единицу. Это стандартный способ чтения модели для числовых переменных.
Например, если один из признаков — сумма сбережений, коэффициент показывает не прямой прирост вероятности одобрения, а изменение логарифма шансов. Чтобы получить более понятный смысл, коэффициент переводят в отношение шансов.
Категориальные признаки
Категориальные признаки тоже можно использовать в логистической регрессии, но сначала их нужно представить в числовом виде. Обычно для этого применяют dummy-переменные или one-hot encoding.
Если признак имеет два состояния, модель сравнивает одно состояние с базовым. Коэффициент показывает, как наличие данного состояния меняет логарифм шансов по сравнению с опорной категорией.
Поэтому логистическая регрессия остаётся удобной и для смешанных данных, где есть и числа, и категории. Главное — корректно закодировать признаки до обучения модели.
Как подбираются коэффициенты
Коэффициенты логистической регрессии обычно оценивают методом максимального правдоподобия. Модель ищет такие параметры, при которых наблюдаемые данные наиболее вероятны.
Идея метода проста по смыслу, хотя внутри есть математика. Для каждого объекта модель выдаёт вероятность положительного класса. Затем оценивается, насколько хорошо эти вероятности согласуются с реальными метками в выборке.
Если объект действительно относится к положительному классу, модели выгодно дать ему высокую вероятность. Если относится к отрицательному — низкую. Чем лучше это совпадение на всей обучающей выборке, тем выше правдоподобие.
На практике оптимизируют не само произведение вероятностей, а логарифм правдоподобия. Так вычисления становятся устойчивее и удобнее. Для поиска параметров используют итерационные методы оптимизации, включая градиентные подходы.
Именно на этом этапе модель «учится» подбирать коэффициенты под данные, а не получает их заранее. После обучения эти коэффициенты уже можно анализировать и использовать для прогнозов.
Какие бывают виды логистической регрессии
Вид логистической регрессии зависит от того, сколько категорий у целевой переменной и есть ли у них порядок. Обычно выделяют бинарную, мультиномиальную и порядковую логистическую регрессию.
| Вид | Когда применяется | Пример целевой переменной |
| Бинарная | Два класса | Спам или не спам |
| Мультиномиальная | Три и более класса без порядка | Выбор категории товара |
| Порядковая | Три и более класса с естественным порядком | Оценка от низкой до высокой |
Бинарная логистическая регрессия
Бинарная логистическая регрессия используется, когда у целевой переменной только два возможных исхода. Это самый распространённый вариант.
Сюда относятся задачи вроде «мошенничество или нет», «клиент уйдёт или останется», «заболевание выявлено или не выявлено». В машинном обучении именно этот сценарий встречается чаще всего.
Мультиномиальная логистическая регрессия
Мультиномиальная логистическая регрессия подходит, когда классов больше двух и между ними нет естественного порядка. Модель оценивает вероятность принадлежности к каждому из вариантов.
Такой формат используют, когда нужно выбрать один класс из нескольких равноправных категорий. Например, определить тип объекта или отнести запись к одному из тематических классов.
Порядковая логистическая регрессия
Порядковая логистическая регрессия нужна, когда классы упорядочены. Здесь важно не только различать категории, но и учитывать их последовательность.
Примером может быть шкала оценок, уровни удовлетворённости или ранги качества. Для таких данных обычная мультиномиальная модель уже теряет информацию о порядке классов.
Где применяют логистическую регрессию
Логистическую регрессию используют там, где нужно оценить вероятность события и принять решение по классу. Метод особенно полезен, когда важна интерпретация признаков, а не только точность прогноза.
Её применяют в финансах, медицине, маркетинге, управлении рисками, социологии и поведенческих исследованиях. Причина проста: модель позволяет не только классифицировать объекты, но и объяснять, какие факторы связаны с исходом.
- Выявление мошенничества. Модель помогает отделять подозрительные случаи от обычных на основе поведения и признаков транзакций или аккаунтов.
- Оценка риска заболевания. По наблюдаемым факторам можно оценивать вероятность наличия или развития состояния.
- Прогноз оттока. По действиям пользователей, клиентов или сотрудников можно оценить вероятность ухода.
- Скоринг и принятие решений. Модель используют там, где нужен вероятностный балл, на основе которого задают порог решения.
Метод особенно удобен в задачах, где важно показать, какой признак увеличивает вероятность исхода, а какой уменьшает. Для прикладной аналитики это часто критично.
Какие ограничения есть у логистической регрессии
Логистическая регрессия хорошо работает не во всех случаях. Её основные ограничения связаны с предположением о линейной связи признаков с логарифмом шансов, чувствительностью к выбросам и риском переобучения.
Если данных мало, а признаков слишком много, модель может подстроиться под шум. В таких случаях используют регуляризацию — она уменьшает влияние менее полезных признаков и помогает сделать модель устойчивее.
Нужно также следить за качеством признаков. Неправильное кодирование категориальных переменных, сильная корреляция между признаками и выбросы могут исказить коэффициенты и ухудшить интерпретацию.
Отдельная тема — выбор порога классификации. Порог 0,5 удобен как базовый, но не всегда подходит для прикладной задачи. Если цена ошибки высока, порог подбирают под метрику и цель бизнеса или исследования.
Когда логистическая регрессия подходит лучше всего
Логистическая регрессия особенно полезна, когда нужен понятный базовый классификатор с вероятностным выходом и интерпретируемыми коэффициентами. Это хороший выбор для бинарных задач и для анализа влияния признаков.
Она часто становится отправной точкой в работе с табличными данными. Причина не в простоте ради простоты. Причина в том, что модель быстро обучается, понятна в разборе и даёт прозрачную логику решения.
Если задача требует именно объяснимости, логистическая регрессия нередко оказывается предпочтительнее более сложных моделей. Когда же граница между классами устроена заметно нелинейно, могут понадобиться другие алгоритмы.
Коротко: логистическая регрессия — это базовый и интерпретируемый метод классификации, который предсказывает вероятность класса через сигмоидное преобразование линейной модели. Она опирается на шансы, логарифм шансов и метод максимального правдоподобия, а применяют её везде, где важны и прогноз, и объяснение результата.