Ценовая война — точное описание происходящего. За полтора года стоимость сопоставимого уровня «интеллекта» упала на порядок: то, что в начале 2024 года стоило около 60 долларов за миллион токенов (токен — фрагмент текста, часть слова или знак препинания; именно в токенах поставщики считают объём обработки), сегодня имеет аналоги по 1–2 доллара. Anthropic снижала прайс на Claude десятками процентов за одно объявление, Google опустил цену Gemini Flash до символических значений — порядка $0,075 за миллион входящих токенов, а затем и ниже. OpenAI отвечал тем же.
Но сводить это к демпингу я бы не стал. Одновременно с борьбой за долю рынка реально дешевеет сама единица вычислений: новое поколение ускорителей (специализированных видеокарт для вычислений), дистилляция (перенос умений большой модели на компактную), оптимизация обслуживания запросов. Плюс снизу давят открытые и китайские модели, которые задают ценовой пол. Поставщику, который хочет продавать дороже этого уровня, приходится объяснять, за что именно платит клиент.
Преимущество сейчас у тех, кто владеет собственным «железом» и всей цепочкой. Google здесь в лучшей позиции: собственные ускорители и дата-центры позволяют опускать цену, не разрушая экономику. Второй тип преимущества — закрепление в корпоративном контуре: когда модель встроена в рабочие процессы, интеграции и регламенты, переключение стоит дорого, и клиент остаётся, даже когда у конкурентов дешевле.
И здесь возникает эффект, который бизнес часто упускает. Цена за токен падает, а совокупные счета растут, потому что потребление увеличивается быстрее, чем дешевеет обработка. Рассуждающие модели, которые перед ответом выстраивают цепочку размышлений, и агенты, самостоятельно выполняющие многошаговые задачи, расходуют на порядки больше токенов, чем обычный диалог. По итогам 2025 года потребление токенов через API (программный интерфейс, через который к модели обращаются сторонние сервисы) в Yandex AI Studio выросло примерно в семь раз, а на западном рынке крупные компании тратили годовые бюджеты на ИИ уже к началу лета. Дешевеющий токен и растущий счёт прекрасно уживаются.
Демпинг работает на входе, а удержание клиента строится на другом. Гибкие схемы уже вытеснили простой прайс за тысячу токенов, и их довольно много.
Первый слой — линейка моделей внутри одного бренда: облегчённые версии для массовых задач и флагманы для сложных. Второй — скидки за предсказуемость: кэширование повторяющихся частей запроса, пакетный режим для задач без срочности, обязательства по объёму. Третий — продажа скорости и приоритета как отдельной услуги: одна и та же модель может стоить по-разному в зависимости от того, нужен ответ за секунду или за минуту.
Самое заметное изменение — появление прослойки между заказчиком и вендорами. Речь об ИИ-роутерах: сервисах, которые дают доступ к моделям разных поставщиков через один ключ, один счёт и общий формат запросов. Крупнейший из них, OpenRouter, к 2026 году собрал более 500 моделей от нескольких десятков провайдеров с комиссией около 5,5 %. Смена модели перестаёт быть проектом и превращается в настройку, а при сбое одного поставщика запрос автоматически уходит к другому. В России есть аналоги таких агрегаторов, например у Selectel или Cloud.ru.
Для ценообразования это принципиально. Издержки на изменение моделей, на которые рассчитывали вендоры, резко снижаются: клиент видит цены в одном интерфейсе и переносит нагрузку туда, где на конкретной задаче дешевле, оставаясь на том же уровне качества.
Появляется и монетизация за пределами подписки. В OpenAI открыто говорят об экспериментах с рекламой для той аудитории, которая не готова платить. Плюс корпоративные тарифы, отраслевые продукты и продажа готового рабочего сценария вместо доступа к модели.
В России картина иная. Цены здесь заметно выше зарубежных: по расчётам Nodul, миллион входящих токенов у GigaChat 2 max стоит около 650 руб., у Alice AI LLM — порядка 660 руб. против 140 руб. у GPT-5.2. Ценовой войны в таком виде у нас нет, конкуренция идёт за интеграцию, соответствие требованиям и работу внутри контура заказчика. Роутеры у нас тоже появились, но выросли из другой потребности — легального и технически возможного доступа к зарубежным моделям. По оценке участников рынка, этот сегмент достиг примерно 3 млрд руб. в год, а весь рынок больших языковых моделей в стране в 2026 году прибавляет около 35 % и приближается к 19,6 млрд руб.
Для большинства компаний этот вопрос звучит иначе, чем задан. Доля в 80–90 % описывает экономику разработчиков моделей — нескольких десятков компаний в мире, которые сами обучают большие модели. У бизнеса, который берёт готовую модель и встраивает её в процессы, строки «обучение» в бюджете нет вообще: весь счёт складывается из инференса, то есть повседневной работы модели на запросах, плюс интеграция и сопровождение. Так что вопрос о себестоимости инференса для них означает вопрос о расходах на ИИ целиком.
Начну с рычагов, которые доступны, даже если вы просто платите за доступ по API. Первый и самый действенный — маршрутизация: типовые обращения уходят на дешёвую модель, сложные на флагманскую. Обычно выясняется, что дорогой моделью обрабатывают массу задач, которым хватило бы простой. Второй — гигиена контекста: в запрос из осторожности кладут всю переписку и половину базы знаний, и компания платит за каждый лишний токен в каждом обращении. Третий — сохранение повторяющихся частей запроса и пакетный режим для задач, которым не нужен мгновенный ответ; у большинства поставщиков и то и другое тарифицируется со скидкой.
Если модель развёрнута в собственном контуре, добавляются инженерные приёмы. Квантование снижает точность вычислений, и переход к половинной точности обычно проходит незаметно для качества. Дистилляция переносит поведение большой модели на компактную: когда задачу вместо модели на 70 млрд параметров закрывает модель на 8–14 млрд, потребность в видеокартах падает в четыре-восемь раз. Группировка запросов в пакеты и спекулятивное декодирование, где маленькая модель предлагает продолжение, а большая его проверяет, поднимают пропускную способность оборудования. В сумме такие меры дают экономию порядка 60–80 %.
И общее правило для обоих случаев. У оговорки «без ущерба качеству» есть цена: агрессивное сжатие модели и урезанный контекст заметнее всего бьют по сложным многошаговым задачам, а на простых проверках это можно не увидеть. Поэтому любая оптимизация имеет смысл только вместе с собственным набором проверочных примеров — без замера до и после вы не отличите экономию от тихой деградации. Оптимизация без проверки — это самообман, который вскрывается через несколько месяцев.
К самой цифре у меня есть вопросы. Исследование разложило доллар так: 44 цента — исправление ошибок, 27 центов — переписывание сгенерированного кода, 11 центов — задержки на ревью, то есть на проверке кода коллегами, и 18 центов доходит до продукта. Но построено оно на анализе пул-реквестов — заявок на изменение программного кода — в инженерных командах, то есть измеряет исключительно разработку программного обеспечения. Выпущено исследование компанией, которая продаёт инструмент контроля качества ИИ-кода, — она измеряет проблему, которую сама же берётся лечить. И база сравнения неудобная: разработка и до всякого ИИ тратила 75–80 % усилий на поддержку, отладку и ревью. Цифра эффектная, переносить её на бизнес целиком я бы не стал.
Гораздо полезнее посмотреть на механизм, который за ней стоит, — он универсален и к программированию не привязан. ИИ дёшево производит черновик и почти ничего не берёт на себя в части проверки. Поэтому в любой функции возникает одна и та же картина. Юрист получает проект договора за минуту и сверяет формулировки. Маркетолог генерирует двадцать вариантов текста и тратит время на выбор и правку. Аналитик получает готовую сводку и перепроверяет цифры, потому что отвечает за них он, а не модель. Экономия тут возникает, что проверить проще, чем собирать всё с нуля.
Что до эры жёсткого ROI — возврата на вложенные средства, — она, на мой взгляд, уже началась. Финансовые директора перестали принимать отчёты в формате «сэкономили четыре часа в неделю» и требуют связи с прибылью. Gartner ожидает, что более 40 % агентских проектов закроют к 2027 году из-за расходов и неочевидной ценности. Это и есть отрезвление.
Практический вывод для компании простой: считать нужно полную стоимость цикла до пригодного результата — генерацию вместе с проверкой, переделками и согласованиями. Цена самой генерации здесь лишь одна из строк. Часто выгоднее сузить задачу так, чтобы результат можно было принимать без сплошной перепроверки, чем экономить на токенах. И почти всегда экономику губит процесс, который оставили прежним: можно вдвое удешевить генерацию и не получить ничего, если ответ по-прежнему трижды проверяют вручную.
Для рынка последствия будут здоровыми. Вырастет спрос на компактные специализированные модели вместо того, чтобы звать универсальный флагман на любую задачу. Оценка качества из необязательной практики станет обязательной: без набора тестов невозможно доказать, что новая версия ничего не сломала. Усилится маршрутизация и гибридные схемы. И поставщики начнут двигаться в сторону продажи готового результата, потому что продавать сырые токены на падающем рынке становится невыгодно.
Здесь полезно развести две цифры, которые в публикациях часто смешивают. Среди тех, кто нейросетями уже пользуется, платить готовы больше половины: по июньскому опросу «Авито Работы» среди двух тысяч респондентов таких 55 %, а средний заявленный бюджет — около 2176 руб. в месяц. Если же брать всё население, доля готовых платить падает примерно до 10 %. Отсюда и расхождение цифр в публикациях.Структура ответов важнее среднего значения. До 1000 руб. в месяц готовы отдавать 28 % пользователей, от 1001 до 3000 руб. — ещё 14 %, и лишь 6 % допускают траты свыше 5000 руб. Молодая аудитория 18–24 лет называет более высокие суммы, в среднем около 3493 руб.Из этого складывается практический ответ. Средние 2176 руб. вытягивает вверх меньшинство с большими бюджетами, а самая крупная группа — 28 % — называет сумму до 1000 руб. Это и есть массовая планка: она совпадает с привычной ценой «ещё одной подписки» в одном ряду с музыкой и онлайн-кинотеатром — столько человек в принципе готов отдавать за любой такой сервис. Всё, что выше двух тысяч, оплачивает профессиональный сегмент, для которого нейросеть стала рабочим инструментом.Причины низкой планки понятны: многолетняя привычка к бесплатному контенту, усталость от числа подписок и наличие бесплатных ассистентов внутри экосистем. Поэтому массовая монетизация в России, скорее всего, пойдёт через пакетные подписки, где ИИ входит в состав экосистемы и не выглядит отдельной строкой расходов. Продавать нейросеть отдельным чеком широкой аудитории сложно.
Под угрозой находится безлимит, а бесплатный тариф — совсем другая история. Терли говорил именно о безлимитных планах, сравнив их с безлимитным тарифом на электричество, который «просто не имеет смысла», и назвал нынешнюю модель подписки временной подпоркой на период дефицита мощностей.
Экономика здесь простая. При фиксированной цене подписки издержки на пользователя переменные, и с приходом агентов разброс стал огромным: один человек задаёт десяток вопросов в месяц, другой запускает агента, который сутками ходит по инструментам и сжигает миллионы токенов. Плоский безлимит в такой конструкции убыточен на тяжёлых пользователях и переплачен для лёгких.
Поэтому речь идёт об уплотнении бесплатного уровня, и отменять его никто не собирается. Уже сейчас тарифы различаются доступом к моделям разных классов, лимитами на тяжёлые операции и кредитами на агентские сценарии и генерацию видео. Ожидаю, что в ближайшие год-два слово «безлимитный» из верхних тарифов практически уйдёт, уступив место комбинации абонентской платы и оплаты за потребление сверх включённого объёма.
Бесплатный уровень при этом сохранится, и причин две. Это главный канал привлечения и источник обратной связи для улучшения продукта. И под него уже подбирают отдельную модель монетизации: в OpenAI прямо говорят об экспериментах с рекламой для тех, кто не может позволить себе подписку. Так что бесплатный тариф станет строже по лимитам и, вероятно, с рекламой, но никуда не денется.
В России этот сценарий будет мягче. Ассистенты встроены в экосистемы и субсидируются другими продуктами компаний, поэтому бесплатный доступ здесь выполняет роль удержания в экосистеме. Исчезновение бесплатного уровня на нашем рынке я считаю маловероятным.




_69301ca9a5501.jpg)


