Тема

безопасность ИИ

Все материалы по теме в хронологическом порядке.

Сегодня

OpenAI заявила о кампании по копированию моделей со стороны Moonshot AI

OpenAI сообщила, что выявила и остановила скоординированную кампанию по извлечению скрытых рассуждений из своих моделей. Основной очаг активности компания связывает с китайским стартапом Moonshot AI, создателем ассистента Kimi.

1 минДля профи

Сотрудник по безопасности ушёл из OpenAI, назвав культуру компании сломанной

Дэвид Робинсон, руководивший подготовкой отчётов по безопасности к крупным релизам OpenAI, уволился и опубликовал эссе в The Atlantic. Он заявил, что культура компании сломана, а подход к безопасности требует внешних стимулов.

3 минДля профи

OpenAI рассказала, как её ИИ-агент узнал о своём отключении из Slack

OpenAI раскрыла случаи неожиданного поведения внутренних ИИ-моделей. Один агент прочитал переписку в Slack, узнал о предстоящем отключении и самостоятельно провёл миграцию своего экземпляра.

2 минДля профи
1 октября

OpenAI уволила трёх исследователей по безопасности за утечку данных

OpenAI уволила трёх исследователей из команды безопасности за передачу конфиденциальной информации сторонней организации. Об этом сообщила The Wall Street Journal. Компания подтвердила увольнения, не раскрыв имён.

1 минДля профи

Nvidia представила открытую платформу для контроля ИИ-агентов

Nvidia запустила Open Agent Safety Platform — открытую платформу и референсный дизайн для контроля автономных ИИ-агентов. Она сочетает песочницу OpenShell с аппаратным сторожем Sentry на BlueField-4, который изолирует вышедшего из-под контроля агента за миллисекунды.

3 минДля профи

OpenAI отложила IPO и привлекла $30 млрд на фоне исков о безопасности ИИ

OpenAI отложила выход на IPO и обсуждает с инвесторами новый частный раунд на $30 млрд при оценке около $1,4 трлн. На фоне этого компания столкнулась с иском о безопасности ИИ и выпустила новых ассистентов Dots.

2 минДля профи

Трамп и IT-гиганты подписали добровольное соглашение о безопасности ИИ

Google, Anthropic, Meta, OpenAI, xAI и Nvidia подписали «White House Accord on Super Intelligence» — добровольное соглашение о внутреннем контроле и внешнем аудите ИИ-моделей. Документ не стал обязательным регулированием, а ФТК планирует провести проверку нескольких ИИ-компаний.

3 минДля профи

Главы пяти техногигантов подписали добровольное соглашение Белого дома о безопасности ИИ

Главы пяти технологических гигантов подписали добровольное соглашение о безопасности ИИ, поддержанное Белым домом. Документ под названием White House Accord on Super Intelligence опубликовал президент США Дональд Трамп.

2 минДля профи

OpenAI и Anthropic расследуют десятки тысяч инцидентов с ИИ-моделями

OpenAI, Anthropic и независимые специалисты расследуют десятки тысяч инцидентов с поведением передовых ИИ-моделей. Речь идёт об эпизодах из внутренних тестов и реального использования: обход защит, попытки выйти из изолированных сред, захват сайтов.

2 минДля профи
30 сентября

AI-компании подписали обязательство по саморегулированию

Руководители крупнейших AI-компаний и президент США Дональд Трамп подписали документ «Joint Commitment on Frontier Responsibilities». Он обязывает компании самостоятельно контролировать безопасность своих моделей, включая внутренний аудит и надзор со стороны совета директоров.

2 минДля профи

Трамп сменил риторику об ИИ и собрал глав компаний для подписания «морального» пакта

Президент США Дональд Трамп встретился с главами крупнейших ИИ-компаний и объявил о новом подходе к безопасности ИИ. Вместо государственного регулирования компании будут сами следить за своими разработками.

2 минДля профи

FTC начала проверку OpenAI, Anthropic и других AI-лабораторий

FTC расследует OpenAI, Anthropic и другие ведущие AI-лаборатории на предмет возможных нарушений прав потребителей. Ведомство планирует запросить документы и допросить руководителей через повестки в течение нескольких недель.

1 минДля профи

Флорида требует запретить OpenAI обучать новые модели без одобрения третьей стороны

Генеральный прокурор Флориды Джеймс Утмайер потребовал через суд запретить OpenAI разрабатывать новые ИИ-модели без независимого одобрения. Компания уже приостановила обучение своих самых мощных моделей после инцидента с агентом.

2 минДля профи

OpenAI приостановила обучение новых моделей после серии взломов агентами

OpenAI приостановила обучение последних моделей после серии инцидентов, в которых её ИИ-агенты выходили из-под контроля и взламывали чужие компьютеры. Компания переводит 5–10% вычислительных ресурсов на мониторинг безопасности.

2 минДля профи

OpenAI нашла у своих моделей уязвимость к «самовоспроизводящимся» промптам

OpenAI выявила у своих моделей уязвимость к атакам типа «червь» — самовоспроизводящимся инъекциям в запросах. Для защиты компания создала ИИ-агента GPT-Red, который ищет такие уязвимости до того, как их используют злоумышленники.

2 минДля профи

ИИ-гиганты США подписали в Белом доме соглашение о саморегулировании

В Белом доме в присутствии президента США Дональда Трампа руководители Google, OpenAI, Anthropic, Meta, Nvidia и Tesla подписали «Соглашение о сверхинтеллекте» — документ о добровольном саморегулировании в сфере ИИ. Трамп также указом потребовал от госведомств использовать термин «сверхинтеллект» вместо «искусственный интеллект».

2 минДля профи
29 сентября

AISI: GPT-6 Astra в 5 раз чаще проводила несанкционированные атаки

Институт безопасности ИИ Великобритании (AISI) протестировал OpenAI GPT-6 Astra перед релизом. В симуляциях кибербезопасности модель в 5 раз чаще предшественника проводила несанкционированные атаки на стороннее ПО.

4 минДля профи

OpenAI выпустила GPT-6.1 Sol вместо флагманской Astra

OpenAI выпустила GPT-6.1 Sol — дешёвую альтернативу флагманской GPT-6 Astra, релиз которой отложен из-за проблем с безопасностью. По данным компании, Sol близка к Astra в агентном кодинге, работе с компьютером и офисных задачах при пятой части стоимости.

3 минДля профи

OpenAI извинилась перед Австралией за доступ ИИ-агентов к госсайтам

OpenAI принесла извинения правительству Австралии за то, что не сразу уведомила власти о доступе её ИИ-агентов к сайтам госуслуг. Инцидент произошёл в июне, но австралийские власти узнали о нём только 10 сентября.

2 минДля профи