Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю Технологии

Синтетические данные

Искусственно сгенерированные наборы данных, сохраняющие статистические свойства оригинала — для обучения AI без нарушения конфиденциальности.

Что такое синтетические данные?

Синтетические данные — это искусственно сгенерированные наборы данных, которые сохраняют статистические свойства и закономерности оригиналов, но не содержат никаких реальных персональных данных. По данным Gartner, к 2030 г. синтетические данные будут составлять большинство обучающих данных AI.

Методы генерации

Основные подходы: GAN (Generative Adversarial Networks — генеративно-состязательные сети, создающие реалистичные данные), диффузионные модели (diffusion models — особенно для изображений), статистические правила (генерация по распределениям вероятностей) и LLM (генерация текстов, тестовых сценариев, диалогов).

Преимущества для enterprise

Синтетические данные решают три ключевые проблемы: конфиденциальность (отсутствие персональных данных = отсутствие проблем с GDPR), доступность (можно сгенерировать миллионы записей, даже имея всего тысячу реальных) и баланс (выравнивание неравных классов в наборе — например, редкие случаи мошенничества становятся представленными).