Бум ИИ долго держался на простом допущении: чем крупнее модель, тем она сильнее, а значит, рынок будут забирать самые мощные системы. Теперь отрасль может проверить, что произойдет, если это правило перестанет работать.
Рост затрат уже заставил пользователей снова смотреть на более компактные и дешевые модели. Такой подход к выбору моделей появился недавно, и его влияние на рынок пока трудно оценить, но последствия могут быть крупными.
Один из прогнозов сформулировал сооснователь Coinbase Брайан Армстронг. По его мнению, большая часть задач перейдет на более дешевые модели.
«Спрос на интеллект почти бесконечен, но 80% рабочих нагрузок будут выполняться на моделях, которые на 99% дешевле, в течение 12–18 месяцев. 20% нагрузок по-прежнему останутся за моделями последнего поколения, где важен максимум когнитивных возможностей», — написал Армстронг в X.
Если этот прогноз сбудется, для рынка ИИ это станет заметным сдвигом. До сих пор большинство компаний конкурировали по качеству, а значит, обычно выбирали самую продвинутую доступную модель.
Если те же задачи можно будет выполнять на дешевых моделях без потери качества, экономика ИИ заметно изменится. Причем часть этой экономии ударит по выручке крупных лабораторий, включая OpenAI и Anthropic, как раз в период подготовки к IPO.
Ключевой вопрос в том, готовы ли компании перейти на более компактные модели. Первые тесты показывают, что при правильной настройке системы дешевые модели могут заменить крупные без потери качества.
В недавнем тесте разработчик юридического ИИ-сервиса Harvey смог сократить расходы на инференс в 3 раза без снижения качества. Тест провели вместе с платформой Fireworks AI. В схеме использовались Claude Opus и GLM 5.1 от Fireworks, а на Opus переводили самые ресурсоемкие задачи.
В результате компания снизила нагрузку на серверное время и общую стоимость работы. Сооснователь Harvey Гейб Перейра сказал TechCrunch: «Качество на первом месте, и в юриспруденции так будет всегда».
Он добавил: «Однако само определение качества меняется: раньше речь шла о том, чтобы использовать самую мощную модель для всего подряд, а теперь — о том, чтобы использовать лучшую модель, которая дает правильный ответ с максимальной эффективностью».
Этот сдвиг часто описывают как противостояние крупных лабораторий с китайскими моделями или системами с открытыми весами. Но важнее другое: разделение проходит между большими и малыми моделями, а не между закрытыми и открытыми.
Сэкономить можно, если перейти с GPT-5.5 на DeepSeek V4 Flash, но похожий эффект даст и переход на GPT-5.4-mini. На рынке уже идет ценовая конкуренция между собственным инференсом крупных лабораторий и независимо размещаемыми моделями с открытыми весами, однако в вопросе выбора между малыми и большими моделями это не так важно.
Сама идея кажется очевидной: не стоит тратить больше вычислительных ресурсов, чем нужно. Но такой подход идет против стратегии, которая долго доминировала в ИИ-индустрии, где ставка делалась на масштабирование и обучение максимально ресурсоемких моделей.
Пока цены во многом субсидировали инвесторы, у клиентов почти не было причин отказываться от самых сильных вариантов. Теперь, когда цены на токены растут, а субсидии сокращаются, пользователи впервые сталкиваются с прямым давлением по затратам.
Пока неясно, заставит ли это корпоративных клиентов массово перейти на более компактные модели. Они могут сокращать расходы и по-другому: делать меньше запросов, уменьшать контекст или отказываться от наименее перспективных сценариев внедрения.
Но если окажется, что большинство внедрений работают так же хорошо на меньших моделях, это может заметно охладить рост спроса на инференс и поставить новые вопросы о том, как оправдать стоимость обучения передовых моделей.
Источник: TechCrunch.