Перейти к содержимому

Дистилляция ИИ по-пекински: как китайские разработчики обучались на ответах американских моделей

Дистилляция по-пекински: как китайские разработчики обучались на ответах американских ИИ

В начале сентября в медиапространстве разгорелась дискуссия вокруг "секретного" доклада о масштабной операции китайских компаний против американских лабораторий искусственного интеллекта. Заголовки создавали впечатление классического кибершпионажа: якобы злоумышленники проникли во внутренние сети исследовательских центров, похитили параметры моделей и вынесли за пределы закрытых контуров результаты многолетней работы.

Однако реальная история оказалась одновременно проще и технологичнее. Речь шла не о взломе серверов и краже файлов, а об использовании легально доступных API. Китайские разработчики отправляли огромное количество HTTPS-запросов через стандартный порт 443, оплачивали вычисления по действующим тарифам и получали от американских моделей готовые ответы, программный код и подробные объяснения решений.

Иными словами, чужие системы фактически сами помогали конкурентам создавать обучающие данные.

Не кража весов, а сбор интеллектуального следа

Ещё несколько лет назад главным признаком промышленного шпионажа считалось хищение весов модели - огромных файлов, содержащих параметры нейросети. Такой подход требует доступа к инфраструктуре, серьёзных вычислительных ресурсов и сложной маскировки.

Современная дистилляция устроена иначе. Исследователям необязательно получать исходные веса. Достаточно регулярно обращаться к сильной закрытой модели и сохранять её ответы. Если система подробно объясняет ход решения, пишет код, исправляет ошибки и анализирует альтернативы, все эти результаты можно превратить в синтетический датасет.

Затем на нём обучается собственная модель. Она не копирует исходную нейросеть буквально, но перенимает характерные схемы рассуждения, структуру ответов, способы декомпозиции сложных задач и методы исправления ошибок. Дорогие вычисления американских компаний таким образом превращаются в материал для обучения конкурирующих систем.

Пример MiniMax

Особенно показательной в отчёте выглядит история стартапа MiniMax. Китайские разработчики использовали модели Anthropic в качестве внешнего "учителя" для генерации программного кода и технических решений.

Чтобы получить нужный тип поведения, они меняли системные инструкции. Модель фактически убеждали, что она является внутренним инструментом самой MiniMax и работает в рамках её исследовательских задач. Такой приём позволял снизить вероятность отказов и направить ответы в нужную сторону.

С технической точки зрения это не обязательно означает полноценный взлом. Компания могла пользоваться доступным сервисом в рамках обычного API-доступа, но применять его в масштабах и целях, которые разработчик модели явно не планировал. Главная проблема здесь заключается не только в нарушении условий использования, но и в том, что сама архитектура облачного ИИ делает подобное извлечение знаний относительно доступным.

Как трафик маскировали под обычных пользователей

Примитивный скрипт с большим числом одинаковых запросов быстро попал бы под капчу, ограничения скорости или фильтры Cloudflare. Поэтому предполагаемая инфраструктура была значительно сложнее.

Запросы распределялись между множеством учётных записей, облачных агрегаторов и прокси-сервисов. Использовались резидентные IP-адреса, благодаря чему трафик выглядел не как поток из одного дата-центра, а как активность множества независимых пользователей из разных регионов.

Дополнительно менялись интервалы между обращениями, браузерные отпечатки и сетевые параметры. Система не должна была демонстрировать механическое повторение одних и тех же команд. Вместо этого поток разбавлялся задачами, похожими на работу реальных разработчиков: генерацией кода, проверкой синтаксиса, поиском ошибок и написанием тестов.

Для антифрод-систем такой трафик мог выглядеть как деятельность большого числа небольших стартапов, которые активно используют платные API. В результате каждая отдельная учётная запись оставалась в пределах допустимых лимитов, а общий объём запросов становился значительным.

Почему блокировка аккаунтов не решает проблему

Первой реакцией провайдеров обычно становится блокировка подозрительных пользователей. Но против распределённой схемы это работает плохо. Заблокированную учётную запись можно заменить несколькими новыми, а инфраструктуру - перенести между провайдерами и регионами.

Поэтому обсуждались более радикальные меры. Среди них - автоматическое ухудшение качества ответов для клиентов, чья активность напоминает массовый сбор данных. Модель могла бы намеренно выдавать менее эффективный код, допускать скрытые ошибки или снижать подробность рассуждений.

Такая стратегия создаёт серьёзные риски для самого поставщика. Отличить промышленного сборщика данных от крупного легального клиента непросто. Реальный стартап также может отправлять тысячи запросов, запускать автоматические тесты и обрабатывать ответы без участия человека. Если качество обслуживания неожиданно снизится, компания просто перейдёт к конкуренту.

Где проходит граница между использованием и злоупотреблением

Открытый API задумывается как инструмент для программной интеграции. Разработчики получают доступ к модели, платят за токены и используют результаты в собственных продуктах. Однако массовая генерация обучающих примеров для создания конкурирующей системы может противоречить правилам сервиса.

Проблема в том, что технически эти действия выглядят почти одинаково. И обычное приложение, и система дистилляции способны отправлять запросы, анализировать ответы и сохранять результаты автоматически. Отличие проявляется не в одном запросе, а в масштабе, структуре и конечной цели использования.

Вендорам придётся совершенствовать не только обнаружение аномалий, но и юридические условия применения API. Одних лимитов скорости будет недостаточно: злоумышленник может распределить поток между множеством аккаунтов. Вероятно, возрастёт роль ограничений на автоматическое накопление ответов, специальных режимов для обучения и более строгого контроля корпоративных клиентов.

Почему "рассуждения вслух" стали уязвимостью

Чем подробнее модель объясняет решение, тем полезнее её ответы для дистилляции. Подробная последовательность действий помогает другой системе учиться не только на финальном результате, но и на пути к нему.

Для программирования это особенно важно. Один ответ может содержать анализ требований, разбиение задачи на этапы, готовый код, проверку граничных случаев и исправление найденных дефектов. Такой материал значительно ценнее короткого фрагмента программы без объяснений.

Поэтому разработчикам моделей приходится искать компромисс между прозрачностью и защитой интеллектуальной собственности. Слишком лаконичные ответы ухудшают пользовательский опыт, а чрезмерно подробные превращают API в источник высококачественных обучающих данных.

Открытые модели меняют расстановку сил

На этом фоне особое внимание привлекают открытые решения, включая Qwen3.8-Flash-Next. Это модель с 125 млрд параметров, которую связывают с будущим развитием семейства Qwen. По заявленным результатам, она способна конкурировать с закрытыми системами в программировании, агентских задачах и сценариях computer use.

Интересен и вопрос требований к оборудованию. Полный checkpoint Qwen3.8-Flash-Next удалось запустить на одной видеокарте RTX 4090. Пиковое потребление видеопамяти составило около 5,95 ГБ. При этом применялся checkpoint в формате bf16 без 4-битной квантизации и дополнительной дистилляции.

Такой показатель выглядит необычно для модели с заявленным числом параметров и, вероятно, связан с особенностями загрузки, архитектуры и режима инференса. Тем не менее сам факт демонстрирует тенденцию: запуск мощных моделей постепенно становится доступнее, а зависимость от нескольких крупнейших облачных платформ снижается.

Что изменится в индустрии

Ситуация показывает, что защита весов сама по себе больше не гарантирует сохранность интеллектуального преимущества. Если конкурент может купить доступ к модели и извлечь из неё миллионы качественных примеров, закрытый checkpoint перестаёт быть единственным ценным активом.

Вендорам придётся защищать не только серверы, но и поведение моделей. Возможными мерами станут ограничение детальности ответов, водяные знаки в синтетических данных, анализ повторяющихся шаблонов запросов и выдача специализированных ответов для автоматизированных клиентов.

Одновременно усилится конкуренция между закрытыми и открытыми системами. Закрытые модели будут стремиться сохранить уникальное качество, а открытые проекты - сокращать разрыв за счёт масштабных датасетов, эффективных архитектур и новых методов обучения.

Главный вывод заключается в том, что современный ИИ можно копировать не только через файлы и закрытые сети. Иногда достаточно оплатить доступ, построить распределённую систему запросов и превратить ответы коммерческой модели в обучающий материал. В эпоху API интеллектуальные возможности становятся сервисом, а любой сервис потенциально может использоваться как источник знаний для следующего поколения конкурентов.

Прокрутить вверх