Железо не помогает, когда нет данных
Компания X в 2024 году собирала данные пользователей из миллионов устройств. Через год после принятия GDPR она получила уведомление от регулятора: хранить такие объёмы информации нельзя без согласия каждого пользователя. На следующий день у неё закончился доступ к данным. Но бизнесу требовалось продолжать разработку моделей для анализа поведения клиентов — и они это сделали.
Как? Федеративным обучением.
В федеративном обучении данные никуда не отправляются. Вместо этого каждая локальная точка (смартфон, сервер банка, больничная система) обучает свою копию модели на своих данных, а затем передаёт только обновления весов нейросети — небольшие числовые векторы размером в несколько мегабайт. Центральный сервер агрегирует эти обновления, формируя глобальную модель и возвращая её участникам.
Математически это выглядит так:
f(x1,…,xK) = 1/K ∑_{i=1}^K f_i(x_i)
где K — количество узлов, x_i — веса модели на узле i, а f_i описывает, насколько хорошо модель согласуется с локальными данными. Цель — добиться согласия всех узлов на одну общую модель x.
Главное отличие от классического распределённого обучения в том, что данные не являются независимыми и одинаково распределёнными (i.i.d.). Они гетерогенны: один узел может знать о диабете, другой — о гриппе, третий — ни о чём из этого. И это нормально для федеративного обучения.
Централизованный вариант требует сервера-оркестратора, который выбирает узлы и собирает обновления. Децентрализованный вариант позволяет узлам общаться напрямую, без единой точки отказа. Но топология сети влияет на скорость сходимости.
Проблема в том, что федеративное обучение не гарантирует конфиденциальность автоматически. Атаки типа «восстановления данных по градиентам» позволяют извлекать информацию о тренировочных наборах из передаваемых весов. Решения есть — дифференциальная приватность и квантование весов, но они требуют тщательной настройки параметров шума.
Синтетические данные: не магия, а математика
В 2025 году более 60 % данных, на которых обучались модели для AI-приложений, были синтетическими. Это не вымысел писателей фантастики — это алгоритмически сгенерированные записи, которые имитируют статистические свойства реальных данных, но не содержат информации о реальных людях или событиях.
Синтетические данные создаются по четырем модальностям: текст, изображения, аудио и табличные данные. Для языка это большие языковые модели (LLM), из которых можно «отбирать» новые предложения, которые выглядят так, будто их написал человек. Для изображений — генеративно-состязательные сети или диффузионные модели, создающие фотографии с нужными статистическими характеристиками.
Для табличных данных ситуация сложнее. Представьте, что вы работаете в банке и хотите протестировать рекомендательную систему для кредитов. Вы не можете использовать реальные транзакции клиентов из-за приватности. Вместо этого вы строите генеративную модель на небольшом наборе реальных данных (например, 1000 записей), а затем используете её для создания тысяч синтетических случаев: «клиент живёт в Огайо, купил товар X в феврале», «клиент из Калифорнии отказался от кредита».
Главное преимущество — тестирование. Раньше программисты вручную придумывали данные для проверки логики приложения. Теперь генеративная модель создаёт столько записей, сколько нужно, и с нужными характеристиками: возраст, геолокация, история покупок.
Но есть подводный камень. Синтетические данные не всегда воспроизводят сложные зависимости между переменными. Если в реальности «женщины из определённого района чаще берут кредиты на меньшие суммы», модель может это учесть частично или полностью пропустить. В итоге тестирование на синтетике оказывается оптимистичным: модель кажется рабочей, а в продакшоне — нет.
Калиан Верамачани из MIT объяснил это так: «Синтетические данные не содержат реальных ситуаций. Их ценность в статистической схожести с реальными данными». Если нужно создать реалистичный текст — LLM справляется. Если таблица с финансовыми показателями — нужна отдельная модель, которая поймёт корреляции между доходами, расходами и рисками.
Проблема ещё в том, что синтетические данные не заменяют реальные для обучения модели. Они хороши для тестирования инфраструктуры, но не для финального дообучения большой нейросети. Исключение — когда реальных данных нет вообще: например, в медицине для редких заболеваний или в промышленности для уникального оборудования. В таких случаях можно обучить модель на синтетике, а потом дообучить её на небольшом наборе реальных примеров (few-shot learning).
Дифференциальная приватность: математическая честность
Дифференциальная приватность — это не просто «добавление шума к данным». Это строгая математическая гарантия того, что присутствие или отсутствие одного человека в наборе данных не влияет на результат обучения. Если вы обучаете модель и добавляете шум к градиентам или к финальным весам так, чтобы невозможно было определить, участвовал ли в обучении конкретный человек — вы получаете защиту от атак восстановления данных.
Рассмотрим пример. Банк хочет обучить модель прогнозирования кредитного риска на транзакциях клиентов. Он не может передать данные регулятору или третьим лицам. Вместо этого он использует локальную дифференциальную приватность: каждый узел (филиал) сам добавляет шум к своим градиентам перед отправкой обновления серверу. Сервер агрегирует эти зашумленные обновления, формируя глобальную модель, и возвращает её обратно.
Ключевой параметр — ε (эпсилон). Он контролирует баланс между приватностью и точностью модели. При меньшем ε защита выше, но модель обучается медленнее и хуже. При большем ε проще получить хорошую модель, но риск восстановления данных растёт. В 2014 году Google внедрила локальную дифференциальную приватность в RAPPOR для сбора анонимизированных данных о браузерах.
Проблема в том, что дифференциальная приватность не работает автоматически. Нужно выбирать ε вручную, понимать, какие функции подвержены атакам, и проверять, не утратила ли модель полезность из-за шума. В 2025 году появились подходы к «unlearning» — удалению данных из уже обученной модели без доступа к исходному набору. Это важно для случаев, когда компания нарушает закон или пользователь отзывает согласие на обработку его информации.
Один из методов работает так: если модель обучается на нескольких независимых наборах данных, её можно представить как усреднение двух подмоделей — тех, что видела конкретный набор, и тех, что нет. Чтобы «забыть» один набор, достаточно отсечь его вклад в общую модель. Но это требует специальной архитектуры обучения и дополнительных вычислений.
Другой подход использует квантование весов: вместо хранения чисел с плавающей точкой (float32) веса округляются до целых или полуцелых значений. Это уменьшает пространство поиска атакующего, но может ухудшить производительность модели.
Есть и гибридные методы. Например, федеративное обучение с дифференциальной приватностью: каждый узел добавляет шум к своим градиентам, сервер агрегирует зашумленные обновления. Эксперименты показывают, что модель достигает высокой точности даже без шума, если число узлов велико и они гетерогенны. Но это не универсальное решение — нужно тестировать каждый кейс отдельно.
Реальные кейсы: где это работает, а где нет
В телекоммуникациях федеративное обучение используется для моделирования поведения пользователей на смартфонах без передачи их активности в облако. Крупные операторы обучают модели распознавания сценариев (например, «пользователь собирается купить тариф» или «ему нужно помочь с настройкой Wi-Fi»), при этом данные остаются на устройствах клиентов.
В здравоохранении ситуация сложнее. Больницы не хотят передавать медицинские записи в центральный сервер из-за HIPAA и GDPR. Федеративное обучение позволяет создать общую модель диагностики диабета, где каждая больница обучает свою копию на локальных данных и передаёт только обновления весов. Но проблема в гетерогенности: одна больница работает с МРТ, другая — с УЗИ, третья — с лабораторными анализами. Модель должна уметь работать с разными модальностями, что требует сложной архитектуры (например, мультимодальных нейросетей).
В финтехе синтетические данные используются для тестирования рекомендательных систем и антифрод-моделей. Банк генерирует миллионы транзакций с нужными характеристиками: суммы, категории, геолокации, чтобы проверить, как модель реагирует на аномалии. Если синтетика не воспроизводит реальные паттерны мошенничества — тестирование бессмысленно. Поэтому часто используют гибридный подход: обучают модель на синтетике, дообучают на небольшом наборе реальных данных с согласия пользователей.
В промышленности есть уникальный кейс: компания производит уникальное оборудование и не может делиться данными о его работе из-за коммерческой тайны. Она обучает модель на внутренних данных, а затем использует федеративное обучение для обмена знаниями с партнёрами, которые работают на похожем оборудовании. Обновления весов передаются без раскрытия деталей работы оборудования.
Проблема в том, что эти методы не заменяют традиционное обучение на реальных данных. Они дополняют его в случаях, когда данные недоступны по закону или коммерческим причинам. Если есть возможность собрать данные законно — лучше сделать это. Синтетика и федеративное обучение нужны там, где сбор данных невозможен или запрещён.
Итоги: три инструмента для одной задачи
Федеративное обучение решает проблему передачи данных, но не гарантирует приватность автоматически. Синтетические данные хороши для тестирования, но не всегда воспроизводят сложные зависимости. Дифференциальная приватность даёт математическую гарантию защиты, но требует настройки и может снижать точность модели.
В 2025 году более 60% данных для AI-приложений были синтетическими. Это не означает, что реальные данные перестали нужны — это означает, что индустрия научилась работать с ограничениями. Компании используют комбинацию методов: обучают модель на доступных данных, дообучают её на синтетике для покрытия редких случаев, применяют федеративное обучение для обмена знаниями между партнёрами и добавляют дифференциальную приватность там, где это требуется законами.
Главный урок в том, что отсутствие доступа к данным — не конец разработки. Это ограничение, которое можно обойти другими методами. Вопрос лишь в том, готовы ли вы платить за это дополнительные вычислительные ресурсы, время на настройку и тестирование.