bg
Госуправление и сервисы для граждан
07:10, 12 августа 2026
views
17

В России принят документ, который даст новый импульс развитию ИИ

Обмен наборами данных между организациями упростится, а российские технологии и платформы могут вызвать интерес на зарубежных рынках.

Как оценить качество датасетов

В России утверждена серия из трех предварительных национальных стандартов (ПНСТ), регулирующих создание и использование синтетических данных – искусственно сформированных наборов, воспроизводящих статистические свойства реальных данных, но не связанных напрямую с конкретными людьми. Речь идет о ПНСТ 1064-2026 «Синтез данных. Основные положения», ПНСТ 1065-2026 «Синтез данных. Архитектура процесса синтеза данных. Методы синтеза» и ПНСТ 1066-2026 «Синтез данных. Описание результатов процесса синтеза. Методика оценки качества». Они уже приняты Росстандартом и должны вступить в действие 1 сентября 2026 года.

Стандарты разрабатывались «Ассоциацией больших данных» при участии АНО «Национальный технологический центр цифровой криптографии». Работа началась в 2025 году.

Документы устанавливают общие правила генерации синтетических данных, архитектуру соответствующих систем, методы оценки качества и приватности. Эти данные позволяют создавать большие датасеты там, где реальные сведения недоступны, содержат персональные или коммерчески чувствительные данные либо их сбор слишком дорог. Впервые в России появилась единая методологическая база, по которой компании смогут оценивать качество и безопасность синтетических датасетов.

Обмен данными станет проще

Теперь российским разработчикам будет доступна расширенная ИИ-база данных. Работа с такой базой может быть востребована в областях, где одновременно требуется много данных для машинного обучения и действуют повышенные требования к конфиденциальности: в банках, телекоме, госсекторе, медицине и промышленности. Кроме того, стандартизация может упростить обмен датасетами между организациями: появятся унифицированные требования к генерации данных, документированию процесса, оценке качества и приватности.

Технологии генерации и безопасного обмена данными и корпоративные платформы подготовки датасетов для ИИ со временем могут стать и экспортным продуктом. Во всяком случае, в проектах стандартов указывалось, что прямых международных и региональных аналогов разработанных документов на момент подготовки не было. Это дает России возможность продвигать собственные подходы к стандартизации синтетических данных, в том числе в рамках технологического сотрудничества со странами БРИКС.

От проекта до апробации – полтора года

Еще в 2023 году «Сбер» разработал собственную экосистему генерации синтетических данных для обучения ИИ и работы с конфиденциальными массивами – SyntData. В 2024 году сервис был включен в Единый реестр российского ПО. А уже в январе 2025 года «Ассоциация больших данных» сообщила о разработке предварительного стандарта синтеза данных – совместно со «Сбером» и другими участниками рынка. В сентябре же «Ассоциация больших данных» и Академия криптографии провели семинар, посвященный архитектуре систем синтеза, дифференциальной приватности, GAN- и VAE-генераторам, а также методам оценки качества синтетических данных.

В июне 2026 года о синтетических данных говорили уже как о части более широкой повестки экономики данных. А в июле Росстандарт принял серию ПНСТ 1064–1066. Таким образом, работа, начатая в 2025 году с проекта стандарта, перешла к официальной апробации нормативных документов.

Реальные данные не исчезнут

В ближайшие три года стандарты должны быть испытаны на практике. ПНСТ 1064 и 1066 рассчитаны на срок до 1 сентября 2029 года, после чего накопленный отраслевой опыт может быть использован при пересмотре документов или переводе требований в постоянные национальные стандарты.

Лучший эффект вероятен в сферах, где нехватка доступных качественных данных ограничивает внедрение ИИ. При этом синтетические данные не стоит рассматривать как полную замену реальным: качество моделей непосредственно зависит от того, насколько искусственный датасет воспроизводит реальные закономерности и не переносит ошибки или смещения исходных данных. Именно поэтому отдельный документ серии посвящен методикам оценки качества и приватности.

С вводом в действие национального стандарта синтеза данных будет обеспечена прозрачность процесса синтезирования, надежность архитектуры и определены критерии качества данных. Синтетические данные становятся реальной альтернативой обезличенным данным, которые сегодня, зачастую, скованы излишними регуляторными ограничениями. При соблюдении требований приватности, синтетические данные не несут в себе рисков и открывают прорывной путь к достижению целей по доступности данных, необходимых для обучения искусственного интеллекта. Надеемся, что с внедрением национального стандарта синтеза данных мы сможем обеспечить такие требования и ввести синтетические данные в широкий оборот в нашей стране
quote
like
heart
fun
wow
sad
angry
Последние новости
Главное
Рекомендуем
previous
next