img
img21 сентября 2026 в 09:17

Экономика ИИ: скидки по 90 % и растущие счета

Главные игроки рынка ИИ снижают цены на свои нейросетевые модели. Дисконт – следствие растущей конкуренции. Однако пользователям радоваться рано: токены дешевеют, но совокупные счета растут. Влияет на отрасль и дефицит вычислительных мощностей. Циркулируют разговоры о завершении эпохи безлимитного искусственного интеллекта. Приведет ли это к исчезновению бесплатных ИИ-моделей? Пойдут разработчики по пути оптимизации расходов или будут искать дополнительные способы монетизации? О новой экономике рынка нейросетей «Телеспутник» поговорил с директором по развитию технологий и искусственного интеллекта GS Labs Ярославом Якимовым.

Главные игроки рынка ИИ снижают цены на свои нейросетевые модели. Дисконт – следствие растущей конкуренции. Однако пользователям радоваться рано: токены дешевеют, но совокупные счета растут. Влияет на отрасль и дефицит вычислительных мощностей. Циркулируют разговоры о завершении эпохи безлимитного искусственного интеллекта. Приведет ли это к исчезновению бесплатных ИИ-моделей? Пойдут разработчики по пути оптимизации расходов или будут искать дополнительные способы монетизации? О новой экономике рынка нейросетей «Телеспутник» поговорил с директором по развитию технологий и искусственного интеллекта GS Labs Ярославом Якимовым.
Крупные американские технологические компании — Google, OpenAI и Anthropic — этим летом снизили цены на свои ИИ-модели. Можно ли говорить, что рынок перешёл в стадию «ценовой войны»? У кого, на ваш взгляд, в ней сейчас преимущество?

Ценовая война — точное описание происходящего. За полтора года стоимость сопоставимого уровня «интеллекта» упала на порядок: то, что в начале 2024 года стоило около 60 долларов за миллион токенов (токен — фрагмент текста, часть слова или знак препинания; именно в токенах поставщики считают объём обработки), сегодня имеет аналоги по 1–2 доллара. Anthropic снижала прайс на Claude десятками процентов за одно объявление, Google опустил цену Gemini Flash до символических значений — порядка $0,075 за миллион входящих токенов, а затем и ниже. OpenAI отвечал тем же.

Но сводить это к демпингу я бы не стал. Одновременно с борьбой за долю рынка реально дешевеет сама единица вычислений: новое поколение ускорителей (специализированных видеокарт для вычислений), дистилляция (перенос умений большой модели на компактную), оптимизация обслуживания запросов. Плюс снизу давят открытые и китайские модели, которые задают ценовой пол. Поставщику, который хочет продавать дороже этого уровня, приходится объяснять, за что именно платит клиент.

Преимущество сейчас у тех, кто владеет собственным «железом» и всей цепочкой. Google здесь в лучшей позиции: собственные ускорители и дата-центры позволяют опускать цену, не разрушая экономику. Второй тип преимущества — закрепление в корпоративном контуре: когда модель встроена в рабочие процессы, интеграции и регламенты, переключение стоит дорого, и клиент остаётся, даже когда у конкурентов дешевле.

И здесь возникает эффект, который бизнес часто упускает. Цена за токен падает, а совокупные счета растут, потому что потребление увеличивается быстрее, чем дешевеет обработка. Рассуждающие модели, которые перед ответом выстраивают цепочку размышлений, и агенты, самостоятельно выполняющие многошаговые задачи, расходуют на порядки больше токенов, чем обычный диалог. По итогам 2025 года потребление токенов через API (программный интерфейс, через который к модели обращаются сторонние сервисы) в Yandex AI Studio выросло примерно в семь раз, а на западном рынке крупные компании тратили годовые бюджеты на ИИ уже к началу лета. Дешевеющий токен и растущий счёт прекрасно уживаются.

img
Ярослав Якимов
Директор по развитию технологий и искусственного интеллекта GS Labs
Цена за токен падает, а совокупные счета растут: потребление увеличивается быстрее, чем дешевеет обработка.
img
Демпинг — это сейчас единственное оружие? Или компании будут искать более гибкие подходы к ценообразованию?

Демпинг работает на входе, а удержание клиента строится на другом. Гибкие схемы уже вытеснили простой прайс за тысячу токенов, и их довольно много.

Первый слой — линейка моделей внутри одного бренда: облегчённые версии для массовых задач и флагманы для сложных. Второй — скидки за предсказуемость: кэширование повторяющихся частей запроса, пакетный режим для задач без срочности, обязательства по объёму. Третий — продажа скорости и приоритета как отдельной услуги: одна и та же модель может стоить по-разному в зависимости от того, нужен ответ за секунду или за минуту.

Самое заметное изменение — появление прослойки между заказчиком и вендорами. Речь об ИИ-роутерах: сервисах, которые дают доступ к моделям разных поставщиков через один ключ, один счёт и общий формат запросов. Крупнейший из них, OpenRouter, к 2026 году собрал более 500 моделей от нескольких десятков провайдеров с комиссией около 5,5 %. Смена модели перестаёт быть проектом и превращается в настройку, а при сбое одного поставщика запрос автоматически уходит к другому. В России есть аналоги таких агрегаторов, например у Selectel или Cloud.ru.

Для ценообразования это принципиально. Издержки на изменение моделей, на которые рассчитывали вендоры, резко снижаются: клиент видит цены в одном интерфейсе и переносит нагрузку туда, где на конкретной задаче дешевле, оставаясь на том же уровне качества.

Появляется и монетизация за пределами подписки. В OpenAI открыто говорят об экспериментах с рекламой для той аудитории, которая не готова платить. Плюс корпоративные тарифы, отраслевые продукты и продажа готового рабочего сценария вместо доступа к модели.

В России картина иная. Цены здесь заметно выше зарубежных: по расчётам Nodul, миллион входящих токенов у GigaChat 2 max стоит около 650 руб., у Alice AI LLM — порядка 660 руб. против 140 руб. у GPT-5.2. Ценовой войны в таком виде у нас нет, конкуренция идёт за интеграцию, соответствие требованиям и работу внутри контура заказчика. Роутеры у нас тоже появились, но выросли из другой потребности — легального и технически возможного доступа к зарубежным моделям. По оценке участников рынка, этот сегмент достиг примерно 3 млрд руб. в год, а весь рынок больших языковых моделей в стране в 2026 году прибавляет около 35 % и приближается к 19,6 млрд руб.

img
Сегодня на инференс или обучение приходится до 80–90 % всех затрат на жизненный цикл ИИ-модели. Возможно ли снизить себестоимость инференса без ущерба качеству?

Для большинства компаний этот вопрос звучит иначе, чем задан. Доля в 80–90 % описывает экономику разработчиков моделей — нескольких десятков компаний в мире, которые сами обучают большие модели. У бизнеса, который берёт готовую модель и встраивает её в процессы, строки «обучение» в бюджете нет вообще: весь счёт складывается из инференса, то есть повседневной работы модели на запросах, плюс интеграция и сопровождение. Так что вопрос о себестоимости инференса для них означает вопрос о расходах на ИИ целиком.

Начну с рычагов, которые доступны, даже если вы просто платите за доступ по API. Первый и самый действенный — маршрутизация: типовые обращения уходят на дешёвую модель, сложные на флагманскую. Обычно выясняется, что дорогой моделью обрабатывают массу задач, которым хватило бы простой. Второй — гигиена контекста: в запрос из осторожности кладут всю переписку и половину базы знаний, и компания платит за каждый лишний токен в каждом обращении. Третий — сохранение повторяющихся частей запроса и пакетный режим для задач, которым не нужен мгновенный ответ; у большинства поставщиков и то и другое тарифицируется со скидкой.

Если модель развёрнута в собственном контуре, добавляются инженерные приёмы. Квантование снижает точность вычислений, и переход к половинной точности обычно проходит незаметно для качества. Дистилляция переносит поведение большой модели на компактную: когда задачу вместо модели на 70 млрд параметров закрывает модель на 8–14 млрд, потребность в видеокартах падает в четыре-восемь раз. Группировка запросов в пакеты и спекулятивное декодирование, где маленькая модель предлагает продолжение, а большая его проверяет, поднимают пропускную способность оборудования. В сумме такие меры дают экономию порядка 60–80 %.

И общее правило для обоих случаев. У оговорки «без ущерба качеству» есть цена: агрессивное сжатие модели и урезанный контекст заметнее всего бьют по сложным многошаговым задачам, а на простых проверках это можно не увидеть. Поэтому любая оптимизация имеет смысл только вместе с собственным набором проверочных примеров — без замера до и после вы не отличите экономию от тихой деградации. Оптимизация без проверки — это самообман, который вскрывается через несколько месяцев.

img
Ярослав Якимов
Директор по развитию технологий и искусственного интеллекта GS Labs
Любая оптимизация имеет смысл только вместе с собственным набором проверочных примеров. Без замера качества до и после вы не отличите экономию от тихой деградации
Исследование Entelligence AI показало, что из каждого доллара, потраченного на токены, только 0,18 доллара приносят прямую пользу бизнесу. Остальное уходит на исправление багов, переписывание кода и перепроверку. Насколько далека эра жёсткого ROI, когда экономическая эффективность станет главным аспектом внедрения ИИ? Как это скажется на рынке нейросетей?

К самой цифре у меня есть вопросы. Исследование разложило доллар так: 44 цента — исправление ошибок, 27 центов — переписывание сгенерированного кода, 11 центов — задержки на ревью, то есть на проверке кода коллегами, и 18 центов доходит до продукта. Но построено оно на анализе пул-реквестов — заявок на изменение программного кода — в инженерных командах, то есть измеряет исключительно разработку программного обеспечения. Выпущено исследование компанией, которая продаёт инструмент контроля качества ИИ-кода, — она измеряет проблему, которую сама же берётся лечить. И база сравнения неудобная: разработка и до всякого ИИ тратила 75–80 % усилий на поддержку, отладку и ревью. Цифра эффектная, переносить её на бизнес целиком я бы не стал.

Гораздо полезнее посмотреть на механизм, который за ней стоит, — он универсален и к программированию не привязан. ИИ дёшево производит черновик и почти ничего не берёт на себя в части проверки. Поэтому в любой функции возникает одна и та же картина. Юрист получает проект договора за минуту и сверяет формулировки. Маркетолог генерирует двадцать вариантов текста и тратит время на выбор и правку. Аналитик получает готовую сводку и перепроверяет цифры, потому что отвечает за них он, а не модель. Экономия тут возникает, что проверить проще, чем собирать всё с нуля.

Что до эры жёсткого ROI — возврата на вложенные средства, — она, на мой взгляд, уже началась. Финансовые директора перестали принимать отчёты в формате «сэкономили четыре часа в неделю» и требуют связи с прибылью. Gartner ожидает, что более 40 % агентских проектов закроют к 2027 году из-за расходов и неочевидной ценности. Это и есть отрезвление.

Практический вывод для компании простой: считать нужно полную стоимость цикла до пригодного результата — генерацию вместе с проверкой, переделками и согласованиями. Цена самой генерации здесь лишь одна из строк. Часто выгоднее сузить задачу так, чтобы результат можно было принимать без сплошной перепроверки, чем экономить на токенах. И почти всегда экономику губит процесс, который оставили прежним: можно вдвое удешевить генерацию и не получить ничего, если ответ по-прежнему трижды проверяют вручную.

Для рынка последствия будут здоровыми. Вырастет спрос на компактные специализированные модели вместо того, чтобы звать универсальный флагман на любую задачу. Оценка качества из необязательной практики станет обязательной: без набора тестов невозможно доказать, что новая версия ничего не сломала. Усилится маршрутизация и гибридные схемы. И поставщики начнут двигаться в сторону продажи готового результата, потому что продавать сырые токены на падающем рынке становится невыгодно.

Отечественный сектор B2C практически привык к бесплатному контенту. Какова психологическая планка цены нейросети для обычного пользователя в России?

Здесь полезно развести две цифры, которые в публикациях часто смешивают. Среди тех, кто нейросетями уже пользуется, платить готовы больше половины: по июньскому опросу «Авито Работы» среди двух тысяч респондентов таких 55 %, а средний заявленный бюджет — около 2176 руб. в месяц. Если же брать всё население, доля готовых платить падает примерно до 10 %. Отсюда и расхождение цифр в публикациях.Структура ответов важнее среднего значения. До 1000 руб. в месяц готовы отдавать 28 % пользователей, от 1001 до 3000 руб. — ещё 14 %, и лишь 6 % допускают траты свыше 5000 руб. Молодая аудитория 18–24 лет называет более высокие суммы, в среднем около 3493 руб.Из этого складывается практический ответ. Средние 2176 руб. вытягивает вверх меньшинство с большими бюджетами, а самая крупная группа — 28 % — называет сумму до 1000 руб. Это и есть массовая планка: она совпадает с привычной ценой «ещё одной подписки» в одном ряду с музыкой и онлайн-кинотеатром — столько человек в принципе готов отдавать за любой такой сервис. Всё, что выше двух тысяч, оплачивает профессиональный сегмент, для которого нейросеть стала рабочим инструментом.Причины низкой планки понятны: многолетняя привычка к бесплатному контенту, усталость от числа подписок и наличие бесплатных ассистентов внутри экосистем. Поэтому массовая монетизация в России, скорее всего, пойдёт через пакетные подписки, где ИИ входит в состав экосистемы и не выглядит отдельной строкой расходов. Продавать нейросеть отдельным чеком широкой аудитории сложно.

Глава ChatGPT Ник Терли недавно заявил, что эра безлимитного ИИ не вечна. Значит ли это, что скоро мы увидим исчезновение бесплатных тарифов? Когда это может произойти?

Под угрозой находится безлимит, а бесплатный тариф — совсем другая история. Терли говорил именно о безлимитных планах, сравнив их с безлимитным тарифом на электричество, который «просто не имеет смысла», и назвал нынешнюю модель подписки временной подпоркой на период дефицита мощностей.

Экономика здесь простая. При фиксированной цене подписки издержки на пользователя переменные, и с приходом агентов разброс стал огромным: один человек задаёт десяток вопросов в месяц, другой запускает агента, который сутками ходит по инструментам и сжигает миллионы токенов. Плоский безлимит в такой конструкции убыточен на тяжёлых пользователях и переплачен для лёгких.

Поэтому речь идёт об уплотнении бесплатного уровня, и отменять его никто не собирается. Уже сейчас тарифы различаются доступом к моделям разных классов, лимитами на тяжёлые операции и кредитами на агентские сценарии и генерацию видео. Ожидаю, что в ближайшие год-два слово «безлимитный» из верхних тарифов практически уйдёт, уступив место комбинации абонентской платы и оплаты за потребление сверх включённого объёма.

Бесплатный уровень при этом сохранится, и причин две. Это главный канал привлечения и источник обратной связи для улучшения продукта. И под него уже подбирают отдельную модель монетизации: в OpenAI прямо говорят об экспериментах с рекламой для тех, кто не может позволить себе подписку. Так что бесплатный тариф станет строже по лимитам и, вероятно, с рекламой, но никуда не денется.

В России этот сценарий будет мягче. Ассистенты встроены в экосистемы и субсидируются другими продуктами компаний, поэтому бесплатный доступ здесь выполняет роль удержания в экосистеме. Исчезновение бесплатного уровня на нашем рынке я считаю маловероятным.

img
Ярослав Якимов
Директор по развитию технологий и искусственного интеллекта GS Labs
Под угрозой находится безлимит, а бесплатный тариф — совсем другая история. Он останется: это главный канал привлечения, и под него уже подбирают рекламную модель.

Читайте также

Похожие материалы

Как цифровые двойники помогают предприятиям Петербурга экономить и повышать эффективность

31.07.2026

Дмитрий Петров («Комфортел»): реформа связи окажется непосильным бременем для малых операторов

04.06.2026

Юристы дали оценку правомерности блокировкам доступа к онлайн-кинотеатрам с VPN

29.04.2026

ИИ-тоги недели: Google меняет поиск, ИИ идёт к реальной оптимизации, компании проводят сокращения

22.05.2026

Голос издалека. Сервис «Мобильный избиратель» открывает новые возможности для петербуржцев

25.09.2024

Популярные статьи

Подписка на рассылку

Подпишитесь на рассылку, чтобы одним из первых быть в курсе новых событий

Выбор редакции