Практика и гайды

Что такое количественная оценка неопределённости в машинном обучении

Что такое количественная оценка неопределённости в машинном обучении

Количественная оценка неопределённости в машинном обучении показывает, насколько модели можно доверять в конкретном прогнозе. Она нужна не только для оценки точности, но и для понимания диапазона возможных исходов и причин, по которым предсказание может быть ненадёжным.

Любая модель упрощает реальность. Даже если метрика качества на тестовой выборке выглядит хорошо, это не означает, что каждый отдельный вывод одинаково надёжен. В одних случаях модель видит знакомые данные и ошибается редко. В других — сталкивается с шумом, редкими примерами или неполной информацией. Количественная оценка неопределённости как раз и переводит это состояние из расплывчатого «модель может ошибаться» в измеримый ответ.

Содержание статьи

Что означает неопределённость в машинном обучении

Неопределённость — это мера того, насколько могут колебаться предсказания модели и насколько уверенно она делает вывод. Она отличается от точности: точность показывает близость к верному ответу, а неопределённость — ширину возможного разброса результатов.

Это различие легко увидеть на простом примере. Если система различает только красные и зелёные яблоки, задача обычно уже и чище, и уже. Если той же системе нужно классифицировать фотографии множества видов фруктов в самых разных условиях, разброс вариантов становится больше. Значит, и неопределённость выше.

Когда в модели есть неопределённость, её выходы удобно рассматривать как случайные величины. Тогда результат описывают не одной точкой, а распределением вероятностей. Чем шире распределение, тем меньше уверенность в результате. Для некоторых задач хватает оценки дисперсии, но на практике распределения часто оказываются сложнее обычного гауссовского случая.

Какие виды неопределённости бывают

Обычно выделяют два главных типа: алеаторную и эпистемическую неопределённость. Первая связана с самим шумом и случайностью данных, вторая — с нехваткой знаний у модели.

Алеаторная неопределённость возникает там, где в процессе уже есть естественный разброс. Например, измерения могут быть шумными, а входные данные — неполными или неоднозначными. Даже при хорошем обучении модель не может полностью убрать такую неопределённость, потому что она находится в самих данных.

Эпистемическая неопределённость появляется, когда модель знает слишком мало. Причины могут быть разными: мало обучающих примеров, слабое покрытие редких случаев, ограничения архитектуры, смещение выборки. Этот тип особенно важен, потому что его часто можно уменьшить — например, собрать новые данные или перестроить обучение.

Иногда добавляют ещё вычислительную неопределённость. Она связана не с природой данных, а с ограничениями вычислений, аппроксимациями и упрощениями, которые приходится делать при обучении или выводе.

Зачем нужна количественная оценка неопределённости

Оценка неопределённости помогает понять, насколько надёжен конкретный прогноз и каков диапазон возможных исходов. Это особенно важно там, где ошибка модели влияет на решение человека или системы.

Если модель предсказывает вероятность события, одной цифры недостаточно. Нужно ещё понимать, хорошо ли эта вероятность подкреплена данными, не слишком ли модель самоуверенна и не скрывается ли за аккуратным числом широкий диапазон реальных вариантов. В этом и состоит практическая ценность UQ: она показывает не только ответ, но и степень доверия к нему.

Такой подход полезен в медицине, инженерных расчётах, прогнозировании временных рядов и других задачах, где цена ошибки заметна. Он позволяет выделить, какие источники неопределённости действительно влияют на итог, и подсказывает, куда смотреть при улучшении модели.

Чем UQ отличается от обычной оценки качества модели

Метрики качества говорят, насколько хорошо модель работает в среднем, а UQ показывает, насколько уверенным можно считать отдельный прогноз. Эти вещи связаны, но не совпадают.

Модель может иметь хорошую среднюю точность и при этом быть плохо откалиброванной. Иначе говоря, она часто выдаёт слишком уверенные вероятности там, где данных мало или задача для неё новая. Бывает и обратная ситуация: модель в целом скромно оценивает свою уверенность, хотя по факту попадает в ответ чаще, чем обещает.

Поэтому при анализе полезно смотреть сразу на два слоя. Первый — насколько предсказания близки к истине. Второй — насколько верно модель оценивает собственную уверенность.

Какие методы используют для оценки неопределённости

Основные подходы — методы на основе выборок, байесовские методы, ансамбли и конформное прогнозирование. У каждого подхода свой баланс между точностью оценки, вычислительной стоимостью и удобством внедрения.

На практике редко существует один универсальный способ. Выбор зависит от задачи, типа модели, доступных вычислений и того, нужен ли строгий интервал, вероятностное распределение или просто разумная оценка уверенности.

Методы на основе выборок

Подходы на основе выборок оценивают неопределённость через многократный запуск модели или сценария с изменяющимися входами. По набору выходов строят статистическую картину возможных результатов.

Самый известный вариант — метод Монте-Карло. Идея проста: много раз запускать расчёт с разными случайными значениями на входе и смотреть, как меняется результат. Если выходы сгруппированы плотно, неопределённость ниже. Если разброс широкий, уверенность ниже.

Есть и более экономные схемы, например латинский гиперкуб. Он позволяет покрывать пространство входных значений более равномерно и часто требует меньше запусков.

Отдельно выделяют Monte Carlo dropout. В обычной нейросети dropout используют при обучении как способ регуляризации, чтобы уменьшить переобучение. В варианте для UQ dropout оставляют активным и во время предсказания, а затем делают несколько прямых проходов. В итоге модель возвращает не одно значение, а набор предсказаний, по разбросу которых судят о неопределённости.

Если многократный запуск исходной модели слишком дорог, применяют упрощённые суррогатные модели. Один из известных вариантов — гауссовская регрессия процессов или Gaussian Process Regression, GPR. Такой подход сразу работает с распределением функций и потому естественно выдаёт оценку неопределённости вместе с прогнозом.

Байесовские методы

Байесовский подход представляет параметры модели не фиксированными числами, а вероятностными распределениями. Это позволяет явно учитывать неопределённость на всём пути от исходных предположений до финального вывода.

Смысл здесь в обновлении знаний по мере поступления данных. Есть начальное представление о параметрах, затем оно корректируется наблюдениями. На выходе получают не одну «лучшую» оценку, а распределение возможных значений.

Когда аналитически посчитать такое распределение трудно, используют методы выборки, например MCMC — Markov chain Monte Carlo. Они нужны для работы со сложными апостериорными распределениями, из которых нельзя взять выборку напрямую.

В нейросетях этот подход реализуют через байесовские нейронные сети. В них веса рассматриваются как распределения, а не как жёстко заданные параметры. В результате модель может возвращать:

  • среднее значение предсказания;
  • оценку разброса или дисперсии;
  • интервалы правдоподобных значений;
  • выборки из прогнозного распределения.

Плюс байесовских методов в том, что неопределённость встроена в саму модель. Минус — более высокая вычислительная цена и сложность практической реализации.

Ансамбли моделей

Ансамбль оценивает неопределённость через расхождение между несколькими независимо обученными моделями. Если модели заметно спорят между собой, уверенность в ответе ниже.

Идея здесь очень прикладная. Берут несколько моделей с разной инициализацией, разными подвыборками данных или даже разной архитектурой. Потом сравнивают их предсказания на одном и том же входе. Чем больше разброс, тем выше неопределённость.

Такой подход часто используют в глубоком обучении, потому что он понятен и обычно работает стабильно. Главный недостаток один: нужно обучать и хранить несколько моделей, а это дорого по времени и ресурсам.

Конформное прогнозирование

Конформное прогнозирование строит интервалы или множества предсказаний с контролируемым покрытием. Оно ценно тем, что работает поверх самых разных моделей и требует минимум предположений о распределении данных.

В задаче регрессии этот метод даёт интервал, в который истинное значение должно попадать с заданной частотой. В задаче классификации он может возвращать не один класс, а набор классов, которые модель не готова исключить при выбранном уровне покрытия.

Обычно данные делят на обучающую часть, тестовую базовую часть и калибровочную выборку. На калибровке считают меру неконформности — показатель того, насколько необычным выглядит предсказание. Затем по этим значениям выбирают порог и строят интервалы или наборы ответов для новых объектов.

Это полезно для чёрных ящиков и заранее обученных моделей, где менять внутреннее устройство нельзя или неудобно.

Как оценка неопределённости работает в глубоком обучении

В глубоком обучении оценивать неопределённость сложнее из-за большой размерности, нелинейности и высокой стоимости вычислений. Поэтому на практике чаще всего применяют приближённые методы.

Один из самых распространённых вариантов — глубокие ансамбли. Несколько сетей обучают независимо, а затем смотрят на разброс их ответов. Подход понятный, но ресурсоёмкий.

Другой частый вариант — уже упомянутый Monte Carlo dropout. Он удобен тем, что не требует полной перестройки архитектуры. Нужно лишь оставить dropout активным на этапе вывода и выполнить несколько проходов.

Иногда используют и оценку неопределённости через batch normalization, когда при инференсе случайным образом варьируют усвоенные статистики батча, чтобы получить распределение предсказаний. Это тоже приближённый способ, но для некоторых сценариев он практичен.

Где UQ особенно полезна

Количественная оценка неопределённости полезна там, где нужно принимать решения при неполной уверенности. Она помогает отделять прогнозы, на которые можно опираться сразу, от прогнозов, которые требуют дополнительной проверки.

Один из самых заметных примеров — прогнозирование временных рядов. В финансах, логистике, экономике и погодных моделях мало получить одно число на будущее. Куда важнее понять, насколько широк диапазон допустимых значений. Поэтому здесь часто применяют вероятностные модели, которые выдают распределение, а не одну точку.

Для временных рядов часто используют модели вроде ARIMA. После построения точечного прогноза анализируют остатки — разницу между наблюдаемыми и предсказанными значениями — и на их основе формируют интервалы прогноза. Если интервал широкий, это прямой сигнал о большей неопределённости.

Есть и другой сценарий — активное обучение. В нём модель сама выбирает, какие неразмеченные примеры отправить на разметку следующими. Логика проста: самую большую ценность часто дают именно те объекты, по которым модель сомневается сильнее всего.

Какие метрики используют для UQ

Метрики UQ обычно оценивают либо качество вероятностного прогноза, либо калибровку уверенности. Часто одной метрики недостаточно, потому что разные показатели измеряют разные стороны неопределённости.

Условно их делят на две группы: правильные скоринговые правила и метрики калибровки.

Правильные скоринговые правила

Правильные скоринговые правила оценивают, насколько предсказанное распределение согласуется с реальным исходом. Они особенно полезны для вероятностных моделей, где на выходе есть не одно значение, а распределение.

Если обычная функция потерь сравнивает предсказанную точку с фактом, то скоринговое правило сравнивает уже распределение вероятностей с наблюдаемым результатом.

Часто используют такие метрики:

  • NLL, negative log likelihood — показывает, насколько хорошо вероятностные прогнозы согласуются с наблюдениями;
  • Brier score — применяют в задачах классификации для оценки вероятностей классов;
  • CRPS, Continuous Ranked Probability Score — подходит для непрерывных вероятностных прогнозов, особенно во временных рядах и погодных задачах.

NLL сильно штрафует модель за самоуверенные, но неверные прогнозы. Brier score удобен тем, что ограничен по диапазону значений. CRPS показывает, насколько прогнозное распределение сосредоточено вокруг реального наблюдения.

Метрики калибровки

Метрики калибровки измеряют, соответствует ли заявленная уверенность модели её фактической вероятности быть правой. Если модель говорит «я уверена на 90%», то при хорошей калибровке такие ответы должны быть верными примерно в 90% случаев.

Это особенно важно для классификации, больших языковых моделей и других систем, которые возвращают вероятности или оценки уверенности.

Наиболее известные показатели можно свести в таблицу.

Метрика Что измеряет Когда полезна
ECE Среднее расхождение между уверенностью и фактической точностью по группам предсказаний Для общего сравнения калибровки моделей
MCE Наибольшую ошибку калибровки среди всех групп Когда важен худший участок поведения модели
ACE Ошибку калибровки с адаптивным разбиением на группы Когда размер данных ограничен или распределение вероятностей неравномерно

ECE используют чаще всего. Эта метрика разбивает прогнозы по интервалам уверенности и сравнивает среднюю уверенность с реальной точностью внутри каждого интервала. MCE показывает самый проблемный участок. ACE пытается исправить слабые места фиксированного разбиения, делая группы более равномерными по числу объектов.

Как выбрать подход к оценке неопределённости

Выбор метода зависит от того, что именно нужно получить: интервал, распределение, меру уверенности или гарантию покрытия. Также важны тип модели, вычислительные ограничения и требования к интерпретации результата.

Если нужна понятная и практичная оценка для нейросети, часто начинают с ансамблей или Monte Carlo dropout. Если важна вероятностная строгость, смотрят в сторону байесовских методов. Если модель уже обучена и требуется получить интервалы с контролируемым покрытием, полезно конформное прогнозирование.

Удобно держать в голове короткий ориентир:

  1. Определить, нужна ли оценка на уровне отдельного прогноза или всей модели.
  2. Понять, важна ли строгая вероятностная интерпретация.
  3. Учесть стоимость многократных запусков и обучения нескольких моделей.
  4. Проверить, можно ли изменить архитектуру или доступен только чёрный ящик.
  5. Выбрать метрики, которые покажут и качество вероятностей, и калибровку.

Что нужно запомнить

Количественная оценка неопределённости показывает не только предсказание модели, но и степень доверия к нему. Она помогает увидеть границы применимости модели, уменьшить самоуверенность алгоритма и лучше понять, где нужны новые данные или другой подход к обучению.

Для этого используют выборочные методы, байесовские модели, ансамбли и конформное прогнозирование. А качество самой оценки проверяют скоринговыми правилами и метриками калибровки. Когда модель умеет сообщать не только ответ, но и уровень своей уверенности, её выводы становятся намного понятнее для анализа и принятия решений.