img
img31 июля 2026 в 15:00

Илья Кананыкин (АБД): через пару лет большинство данных в мире будут синтетическими

Отрасль больших данных в России сталкивается со всё новыми вызовами. Число хакерских атак на инфраструктуру растёт, законодательство ужесточается, а искусственный интеллект, стремясь к самообучению, генерирует массивы синтетических данных, подменяя реальную информацию. Или повсеместное развитие ИИ — это всё же благо для отрасли Big data? В рамках Петербургского цифрового форума разбираемся в вопросе вместе с директором Ассоциации больших данных Ильёй Кананыкиным.

Отрасль больших данных в России сталкивается со всё новыми вызовами. Число хакерских атак на инфраструктуру растёт, законодательство ужесточается, а искусственный интеллект, стремясь к самообучению, генерирует массивы синтетических данных, подменяя реальную информацию. Или повсеместное развитие ИИ — это всё же благо для отрасли Big data? В рамках Петербургского цифрового форума разбираемся в вопросе вместе с директором Ассоциации больших данных Ильёй Кананыкиным.
Большие данные (Big Data) сейчас охватывают практически всё: когда человек заходит в сеть, о нем обязательно собирают все данные, куда он ходит, что покупает. Но при этом в последние годы по понятным причинам чаще совершаются хакерские атаки, чаще государство беспокоится о нашей безопасности, вводит какие-то ограничения. Стало ли компаниям в сфере Big Data сложнее собирать данные россиян, и находятся ли сейчас вообще наши данные в безопасности?

Ну давайте начну с того, что данные не все собираются, только те, которые мы даём. Мы там либо нажимаем кнопочку, либо ставим галочку, согласны или не согласны. По поводу безопасности, у нас есть федеральный закон о защите персональных данных и конечно же, все компании нашей ассоциации, безусловно, всегда максимально трепетно относились к таким вещам. 

В этом смысле я не думаю, что принципиально что-то поменялось. Сейчас, наверное, действительно больше фокуса, больше надзора. Но нам с вами точно можно не переживать. У нас есть огромное количество отечественных наработок по части безопасности, которые активно применяются. Естественно, каждый день нам приносят новые вызовы, с которыми члены нашей ассоциации всегда справляются прекрасно, успешно.

Вы сказали про отечественные решения. Их начали развивать после 2022 года или и раньше была нужда именно в отечественных продуктах?

Нет, здесь стоит сказать, что в нашей стране безусловно можно гордиться некоторыми областями. И в частности, компьютер-вижн и безопасность всегда были нашей сильной стороной. Поэтому здесь мы эстафету не подняли, она у нас была изначально.

А вот все поправки в закон, тот же 152 ФЗ, не придушивают ли участников рынка по части сбора данных?

Ну, конечно же, любое регуляторное ограничение потенциально ограничивает бизнес. В этом, собственно, его суть. Мы, как ассоциация, всегда выражаем своё мнение достаточно чётко, регулятору, надзорным органам. Сказать, что диалога не ведется, я не могу. У нас есть большое количество замечаний ко всему происходящему. Это нормальный диалог. Где-то нас слышат больше, где-то нас слышат меньше. Ну, так и должно быть в целом.

Но в целом можно сказать, что государство идет на контакт с участниками рынка?

Да. По всем последним законопроектам, как минимум наше мнение выслушивают, где-то с ним не соглашаются, где-то с ним соглашаются, где-то какие-то компромиссы. Но это диалог постоянный, сразу никогда хорошо не бывает. Поэтому надеемся, что в том числе в рамках подзаконных актов о последнем законопроекте об искусственном интеллекте мы будем дальше отстаивать интересы клиентов наших членов ассоциации, интересы самих организаций, ну и в принципе двигать рынок больших данных и искусственного интеллекта вперед. 

Вот я как раз хотел спросить про искусственный интеллект. Как-то он наверняка упрощает обработку больших данных?

ИИ мы занимались очень давно, машинное обучение – это тоже искусственный интеллект. Просто он выстрелил, когда мы с вами научились говорить с каким-то чат-ботом и он что-то вменяемо начал отвечать. Конечно же он приходит на помощь там, где человек не способен обработать такого объёма данные, в этом его задача.

А искусственный интеллект потихоньку заменяет людей? Или всё-таки всегда нужен будет какой-то живой надзорщик?

Классический вопрос. Мы сейчас находимся в стадии определения, что такое искусственный интеллект, что ему можно, что нельзя. Конечно же, как и все автоматизации, он устраивает некоторое перераспределение обязанностей, распределение временных затрат сотрудников. Что-то теперь делает компьютер, а что-то начинает делать человек. Сказать, что он заменяет, уничтожает рабочие места, это неправильно. Скорее появляются новые профессии, новые задачи. 

Человек может заниматься чем-то более творческим, интеллектуальным. Искусственный интеллект, хоть так называется, но он не интеллект, он не умеет созидать ничего нового. Он умеет подсказывать то, что кто-то уже где-то сказал, и систематизировать это. Поэтому за человеком всегда остаётся создание нового. Здесь ничего не изменится.

Есть такое явление, что искусственный интеллект сам создаёт синтетические данные, чтобы обучать искусственный интеллект. Это не приводит к тому, что потоки данных забиваются мусорным, по сути, трафиком?

Да, синтетические данные – это один из наших основных трендов и в стране, и в мире. Думаю, что через пару лет, у нас была аналитика, порядка 65, если не ошибаюсь, процентов данных в мире будут синтетическими. То, о чем вы говорите, безусловно, есть, но есть и технологии для дообучения систем, обученных на таких данных.

Конечно, система деградирует, если будет обучаться на несуществующих данных. Плюс надо сказать, что синтетические данные не везде могут применяться. Это отличный инструмент, но не для всего. И даже там, где он применяется, с ним тоже надо уметь работать. Но действительно, проблема такая есть, деградация моделей на базе выдуманных историй, она присутствует. 

А что скажете про идею создания суверенного ИИ? Не является ли она вообще мифом, и не будет ли он просто глупее, чем международные аналоги?

Создание суверенного ИИ уже прописано в законопроекте. Значит, это задача, которую нужно решить, я бы так сказал. Наши модели, если мы говорим о больших языковых моделях, действительно сейчас отстают. У нас, в принципе, проблемы с национальным корпусом данных, потому что русского языка в интернете меньше технически, чем китайского или английского. Нас самих меньше, наш условно печатный мир меньше. Поэтому у нас много с этим связано проблем. Понятно, что обыватель смотрит на условный «Гигачат» и «Алису» и оценивает их, но предметные прикладные задачи искусственного интеллекта, они не всегда выражаются в буквах, написанных русским языком. 

Понятно, есть компьютер-вижн, например, тот же самый искусственный интеллект, который не умеет разговаривать, но это один из наших отечественных продуктов, лучших на мировом рынке. А там, где у нас действительно есть проблемы, там как раз есть ответ — это синтетические данные, и другие технологии. Главное, чтобы у нас сейчас регуляторика не задушила это все. 

Синтетические данные за недостатком данных безусловно могут помочь, например, в части обучения моделей. Но опять же, есть области, где они не помогут, например, синтетические данные достаточно бесполезны в творческих всяких историях. Плюс, скажем, какой-нибудь антифрод, когда злоумышленники каждый день придумывают что-то новое. Как, знаете, говорят, генералы все учились на сражениях прошлого, они не всегда придумывают что-то новое.

Есть такая дискуссия по поводу авторских прав, которые мешают обучаться и моделям. Для суверенного интеллекта авторские права это тоже, наверное, препятствие? Что с ними делать?

Действительно, всё, что не дает обучать модели, оно делает хуже эту модель. При этом никто не отрицает прав авторов на созданные ими результаты творческого интеллектуального труда. Поэтому встаёт вопрос об изменении рынка. Скажем, в какой-нибудь Америке эта проблема давно есть, но там во многом этот рынок намного более прогрессивный. У нас часто, я так понимаю, люди ждут, что за них сделают что-то. А рынок работает по-другому. Надо собираться, надо вести диалог. 

И в последнем законопроекте, с моей точки зрения, полностью учтены интересы правообладателей, потому что там четко прописано, что если у вас, например, есть пэйволл, то мы не можем на этом учиться. Это прописано в законе. То есть никто авторов не ущемляет. Там не прописаны все детали, но если мы будем прописывать всё в законопроекте, мы его никогда не выпустим.

Это должен быть рынок, это должна быть структурированная работа. А у нас, к сожалению, пока его не создают, а больше жалуются. А, например, в Америке, как я сказал, уже есть продукты, ассоциации, которые объединяются, защищают свои интересы и получают прибыль.

Читайте также

Похожие материалы

Просто об искусственном интеллекте: «Первый Космический» запустил новый образовательный проект

04.12.2024

Оператор связи рассказал о схеме замедления Telegram

11.02.2026

Российская компания приобретает отечественное ПО на 69 млн рублей

05.12.2024

Эксперт пояснила, в каких случаях за продажу сим-карт грозит штраф до 1 млн рублей

13.01.2026

На Elecard Media Congress 2025 эксперты обсудили новые тренды в видеообработке и вещании

29.05.2025

Популярные статьи

Подписка на рассылку

Подпишитесь на рассылку, чтобы одним из первых быть в курсе новых событий

Выбор редакции