Заявление о крупномасштабной скрытой промышленной дистилляции, направленной на кражу американских технологий, сделал Майкл Кратсиос, одновременно с сообщениями о возможном запрете китайских моделей с открытыми весами, что вызвало резонанс в ИИ-сообществе. Разработчик Moonshot не ответил на запросы о процессе обучения своей модели, а Кратсиос не раскрыл источники обвинений. Его слова перекликаются с комментарием министра финансов США Скотта Бессента о том, что «мы находим водяные знаки наших больших языковых моделей на многих китайских моделях, и это неприемлемо».
Что именно представляют собой эти водяные знаки, неизвестно — Министерство финансов не предоставило разъяснений. Эксперты, однако, скептически оценивают предположение, что именно дистилляция обеспечила модели Kimi K3 её продвинутые возможности. Брейден Хэнкок, исследователь Laude Institute и сооснователь Snorkel AI, заявил TechCrunch: «Я не думаю, что можно получить настолько сильную модель так быстро после появления Fable исключительно за счёт дистилляции.
У них на это просто не было времени. Fable находится в открытом доступе только с 1 июля. Невозможно дистиллировать столько данных, обучить модель и выпустить её за две недели». Нейтан Ламберт из Allen Institute for AI в недавнем подкасте отметил, что, по его мнению, влияние дистилляции снижается по мере приближения китайских моделей к передовому уровню и смещения тренировочных процессов в сторону обучения с подкреплением.
«Если бы это работало, любой мог бы легко догнать GLM или K3, используя их данные для дистилляции. Но от одного только supervised fine-tuning мы этого не видим и не увидим», — пояснил он. Дистилляция требует от лаборатории систематически опрашивать целевую модель, чтобы наработать данные для последующего дообучения.
Иногда при этом явно просят модель показать цепочку своих рассуждений, а в других случаях промпты и ответы используются для обучения новой модели через supervised fine-tuning (SFT). Именно на этапе SFT, по выражению Ламберта, «модель приобретает свои манеры».
Однако он полагает, что преимущества SFT становятся менее значимыми по мере усложнения моделей. Чтобы воспроизвести способности уровня Fable, скорее всего, потребовались бы техники обучения с подкреплением: агент большой модели оценивает ответы малой и корректирует её поведение. Такие прогоны требуют колоссальной инфраструктуры — десятков миллионов агентов.
Использование API передовой лаборатории для этого «было бы безумно дорогим и, вероятно, создало бы временные узкие места, потому что эти модели довольно медленны, и, честно говоря, могло бы вообще не дать прироста производительности». Ранее Anthropic публично обвинила Moonshot, DeepSeek и MiniMax в систематической дистилляции своих моделей, обнаружив миллионы обменов через IP-адреса и другие метаданные. Эти запросы, по заявлению Anthropic, «отличались от нормальных пользовательских паттернов и отражали преднамеренное извлечение возможностей, а не легитимное использование».
Сама дистилляция считается общепринятой практикой в индустрии, не только в Китае: в начале года Илон Маск свидетельствовал, что его компания SpaceXAI дистиллировала модели OpenAI для создания Grok, назвав это распространённым подходом. Грань между дистилляцией и разработкой синтетических датасетов при этом может быть весьма размытой.