Brain-IT реконструирует увиденные изображения по fMRI точнее MindEye2
Учёные представили ИИ-модель Brain-IT, которая реконструирует увиденные человеком изображения по данным функциональной МРТ. Она обошла предыдущие методы по 7 из 8 метрик и показала качественные результаты при 15 минутах записи fMRI нового человека.
- Brain-IT обошла MindEye2 по 7 из 8 метрик: SSIM вырос до 0,486 против 0,431.
- Модель сводит около 40 тысяч вокселей fMRI к 128 функциональным кластерам и Brain Token.
- Качественные реконструкции получены при 30 и 15 минутах данных нового участника.
Учёные разработали ИИ-модель Brain-IT, которая восстанавливает изображения, увиденные человеком, по данным функциональной МРТ (fMRI). Главная проблема предыдущих методов была не в правдоподобии картинки, а в её соответствии реальной: диффузионная модель могла верно определить предметы, но ошибиться с расположением объектов, цветами и деталями.
В Brain-IT эти два типа информации разделили. Модель сводит около 40 тысяч вокселей fMRI к 128 функциональным кластерам, в каждый из которых попадают воксели с похожими характеристиками. Затем кластер превращается в Brain Token — представление информации, с которым работает Transformer.
Как работает модель
Из Brain Token извлекаются два набора визуальных признаков. Первый описывает смысл изображения и подаётся на вход диффузионной модели, определяя, какие объекты и сцены должны получиться. Второй содержит низкоуровневую информацию — общую структуру и расположение элементов. По ним система сначала восстанавливает грубый вариант изображения, который становится начальной точкой для диффузионной генерации.
Такой подход нужен потому, что одной семантики недостаточно для точной реконструкции: диффузионная модель может создать изображение по смыслу, но изменить композицию или цвета. Brain-IT сначала фиксирует грубую структуру, а затем уточняет её под воздействием семантических признаков. По данным авторов, объединение двух веток даёт более точное соответствие исходному изображению, чем использование каждой по отдельности.
Результаты
Для проверки использовали Natural Scenes Dataset — набор данных fMRI восьми человек, которым показывали разнообразные фотографии. В основном сравнении Brain-IT превзошла предыдущие методы по 7 из 8 метрик. Значение SSIM, характеризующее структурное сходство изображений, составило 0,486 против 0,431 у предыдущего лучшего результата MindEye2, а корреляция пикселей выросла до 0,386 против 0,322.
Особенно заметным оказался результат при работе с данными fMRI нового человека. Авторы отмечают, что он сопоставим с показателями предыдущих методов, обучавшихся на полном наборе из 40 часов данных, при 1 часе fMRI у Brain-IT. Качественные реконструкции удалось получить и при 30 и 15 минутах данных нового участника — исследователи называют это первым, по их данным, случаем реконструкций такого качества при 15-минутной записи.
При этом результаты не означают, что система буквально «читает картинку из мозга» за 15 минут: качество реконструкций остаётся ограниченным, а отдельные объекты и детали могут восстанавливаться неправильно. Анализ механизма внимания Brain-IT показал специализацию отдельных токенов: разные токены систематически вносили вклад в разные области предсказываемого изображения, а некоторые преимущественно были связаны с семантически значимыми областями вроде лиц, конечностей или текста. Пока это скорее свойство работы модели, чем готовая новая карта зрительной коры.
Для профиТехнические детали: архитектура, цифры, ссылки
Архитектура Brain-IT: около 40 000 вокселей fMRI сжимаются в 128 функциональных кластеров, каждый из которых преобразуется в Brain Token для Transformer. Из токенов извлекаются два набора признаков — семантический (вход диффузионной модели) и низкоуровневый (структура и композиция), по которым строится грубая реконструкция, уточняемая диффузией.
- Датасет: Natural Scenes Dataset, fMRI восьми человек.
- Метрики: SSIM 0,486 против 0,431 у MindEye2; корреляция пикселей 0,386 против 0,322.
- Превосходство по 7 из 8 метрик.
- Перенос на нового человека: 1 час fMRI даёт результат, сопоставимый с обучением предыдущих методов на 40 часах; качественные реконструкции при 30 и 15 минутах.
Анализ внимания показал специализацию токенов: часть из них связана с семантически значимыми областями (лица, конечности, текст).
Вопросы и ответы
- Что такое Brain-IT?
- ИИ-модель, которая восстанавливает увиденные человеком изображения по данным функциональной МРТ.
- Насколько Brain-IT точнее предыдущих методов?
- Она превзошла предыдущие методы по 7 из 8 метрик: SSIM 0,486 против 0,431 у MindEye2.
- Сколько данных fMRI нужно для реконструкции?
- Качественные реконструкции получены при 1 часе, а также при 30 и 15 минутах записи нового участника.



