OpenAI заявила о кампании по копированию моделей со стороны Moonshot AI

OpenAI сообщила, что выявила и остановила скоординированную кампанию по извлечению скрытых рассуждений из своих моделей. Основной очаг активности компания связывает с китайским стартапом Moonshot AI, создателем ассистента Kimi.

Главное
  • Атака началась в первых числах июля, за двое суток зафиксировано 16 тысяч запросов с более чем 4 тысяч аккаунтов.
  • Всего в связанном кластере OpenAI насчитала более 15 тысяч пользователей, кампания подавлена к 28 июля.
  • OpenAI классифицировала операцию как состязательную дистилляцию и передала данные через Frontier Model Forum и правительственные каналы.
Иллюстрация к новости о дистилляции моделей OpenAI и обвинениях в адрес Moonshot AI
Фото: iXBT

OpenAI заявила, что выявила и пресекла скоординированную кампанию по извлечению защищённых логических рассуждений из своих моделей. По данным компании, центральный кластер активности ведёт к китайскому стартапу Moonshot AI — создателю ИИ-ассистента Kimi. Об этом сообщил iXBT.

Атака началась в первых числах июля. В пиковый период за двое суток было зафиксировано 16 тысяч запросов, отправленных с более чем 4 тысяч учётных записей. Всего OpenAI обнаружила связанную активность в кластере, насчитывающем более 15 тысяч пользователей, и к 28 июля полностью подавила кампанию.

Операцию в OpenAI классифицировали как «состязательную дистилляцию» — метод, при котором выходные данные или цепочки рассуждений одной модели используются для обучения или улучшения другой. Извлечение скрытых ответов и рассуждений даёт конкурентам возможность воспроизводить продвинутые способности, не вкладываясь в дорогостоящую разработку и не создавая собственных механизмов безопасности. По мнению компании, это несёт риски для национальной безопасности и контроля над мощными ИИ-системами.

Злоумышленники не взламывали шифрование, базы данных или хранилища диалогов OpenAI. Вместо этого они манипулировали взаимодействием с моделями так, чтобы скрытые внутренние рассуждения проявились в видимой для запрашивающего форме.

В OpenAI подчеркнули, что не уверены, действовал ли один субъект во всех случаях, однако основной очаг активности приписан лицам, аффилированным с Moonshot AI.

Разоблачение состоялось спустя считанные недели после того, как конкурент OpenAI, компания Anthropic, обвинила ряд китайских разработчиков, включая Moonshot AI и Alibaba, в тайном использовании её модели Claude для обучения собственных систем.

Информацией о нынешней атаке OpenAI поделилась с другими разработчиками через Frontier Model Forum и правительственные каналы обмена данными.

Для профиТехнические детали: архитектура, цифры, ссылки

OpenAI описала инцидент как состязательную дистилляцию — извлечение скрытых цепочек рассуждений через манипуляции с взаимодействием с моделью. Атака шла с более чем 4 тысяч аккаунтов, пиковая нагрузка — 16 тысяч запросов за двое суток, общий кластер — свыше 15 тысяч пользователей. Кампания подавлена к 28 июля. OpenAI передала данные через Frontier Model Forum и правительственные каналы. Ранее Anthropic обвиняла Moonshot AI и Alibaba в использовании Claude для обучения своих систем.

Вопросы и ответы

Что такое состязательная дистилляция?
Метод, при котором выходные данные или цепочки рассуждений одной модели используются для обучения или улучшения другой.
Сколько запросов зафиксировала OpenAI?
В пиковый период за двое суток — 16 тысяч запросов с более чем 4 тысяч учётных записей.
Когда кампания была подавлена?
К 28 июля.

Источники

Материал подготовлен редакцией на основе указанных источников. Как мы работаем