О проекте

Контекст — издание об искусственном интеллекте для русскоязычных читателей. Мы пишем для тех, кто просто интересуется ИИ, и для тех, кто работает с ним каждый день.

Каждая новость устроена в несколько слоёв: короткая суть для тех, кому некогда, понятный основной текст и отдельный блок «Для профи» с техническими деталями. Если событие важно для пользователей и компаний в России, мы объясняем, что оно значит именно здесь.

Как новость попадает на сайт

Новости готовит автоматизированная редакционная система. Она собирает материалы, оценивает их, склеивает дубли, пишет статью по первоисточникам и проверяет факты. До читателя доходит малая часть того, что выходит в мире об ИИ: всё второстепенное, рекламное и сомнительное отсеивается по дороге. Ниже — как это устроено, с реальными цифрами за последние 30 дней.

44источника в работе
8 386материалов собрано
413статей опубликовано
5 %материалов доходит до публикации — примерно каждый 20‑й
  1. 8 386 собрано материалов из источников
  2. 756 прошли оценку: про ИИ и интересно читателям
  3. 614 уникальных событий после склейки дублей
  4. 413 опубликовано статей

1. Сбор

Мы читаем официальные блоги компаний-разработчиков, профильные издания, научные публикации и русскоязычные источники — сейчас 44 источника: 31 зарубежный и 13 русскоязычных. Робот проверяет каждые 5 минут, каким источникам пора обновиться; у каждого свой интервал — от 15 до 360 минут. Берём только открытые ленты и страницы, соблюдаем правила robots.txt, вырезаем рекламные метки из ссылок. В работу идут материалы не старше 3 дней.

Список источников

Зарубежные: Anthropic, Google AI Blog, Google DeepMind, Google Research, Hugging Face, MIT Technology Review, OpenAI, Ars Technica, Ars Technica AI, GitHub Blog AI, Import AI, Microsoft Source AI, Mistral AI, NVIDIA Blog, Qwen, Simon Willison, Stability AI, TechCrunch, The Verge, Wired, AWS Machine Learning, Hacker News: AI, Hugging Face Papers, LangChain Blog, SiliconANGLE AI, The Decoder, The Register AI, Tom's Hardware, ZDNet AI, arXiv cs.CL, arXiv cs.LG.

Русскоязычные: TG: gonzo-обзоры ML, TG: Сиолошная, TG: эйай ньюз, Хабр: Сбер, Хабр: Яндекс, 3DNews, CNews, TG: Data Secrets, TG: Denis Sexy IT, iXBT, Хабр: ИИ, Хабр: Машинное обучение, vc.ru.

У каждого источника есть уровень доверия от 1 до 5: официальные блоги лабораторий и крупные издания весят больше, чем агрегаторы и блоги. Доверие учитывается при выборе, какую новость публиковать первой.

2. Оценка: две шкалы от 0 до 100

Каждый материал читает языковая модель в роли выпускающего редактора. Она решает, про ИИ ли это вообще, и ставит два балла:

  • релевантность — насколько это интересно нашей аудитории. Нужно не меньше 60 из 100, иначе материал отсеивается;
  • важность — масштаб события. 90 и выше — крупнейшие релизы и события, о которых напишут все.

Баллы снижаются за рекламу и промо, вакансии, вебинары, подборки «10 лучших промптов», мнения без новости. Повышаются — за то, что влияет на пользователей в России: доступность сервисов, российские модели, цены. За 30 дней на этом этапе отсеяно 7 630 материалов из 8 386 — 91 %. Средняя важность всего собранного — 25 из 100, прошедшего отбор — 61.

3. Склейка дублей: одно событие — одна статья

Об одном событии обычно пишут сразу несколько источников. Материалы с одинаковым ключом события или похожими заголовками склеиваются, и по ним выходит одна статья. Если событие уже опубликовано, новый источник добавляется в готовую статью, а не выходит отдельной новостью. За 30 дней из 756 прошедших отбор материалов получилось 614 событий. В среднем на статью приходится 1,2 источника; 52 из 413 написаны по двум и более.

4. Отбор в публикацию

Новости выходят по расписанию — до 40 в день, с 07:00 до 23:30 по Москве. Это потолок, а не план: события с важностью ниже 35 не публикуются, даже если день получился тихим. В каждый слот выходит лучший кандидат по рейтингу:

важность × 0,6 + релевантность × 0,2 + доверие к источнику × 4 + число источников (до 5) × 3

Рейтинг снижается со временем: свежая новость важнее вчерашней. Самое важное (важность от 90 и не старше 6 часов) выходит сразу, не дожидаясь слота. Средняя важность опубликованных новостей — 59 из 100.

5. Написание по первоисточникам

Система скачивает полные тексты источников — до четырёх на событие — и пишет статью на русском строго по фактам из них. Модели запрещено добавлять цифры, даты, имена и цитаты, которых нет в источниках. У статьи есть лид, три главных факта, основной текст, блок «Для профи» и, когда это уместно, «Что это значит для России». Блок «Для профи» есть у 77 % статей, «Что это значит для России» — у 18 %: его пишем, только если есть что сказать по делу.

6. Проверки: лучше пропустить новость, чем ошибиться

  • Стоп-лист. 25 штампов «нейросетевого» текста («является», «стоит отметить», «революционный», «новая эра» и другие), эмодзи и восклицательные знаки.
  • Числа. Каждое число в статье должно найтись в источниках.
  • Фактчек. Отдельный проход модели сверяет готовый текст с источниками и ищет выдуманные или искажённые факты.

Если проверка находит проблему, текст переписывается с учётом замечаний — до трёх попыток. Не получилось — событие отклоняется, и в слот выходит следующее. За 30 дней на этом этапе отклонено 51 событие из 464 — 11 %.

  • фактчек нашёл неточность — 14;
  • в открытом доступе слишком мало текста, чтобы написать по фактам — 19;
  • число не подтвердилось источниками — 10;
  • не удалось убрать штампы или дотянуть текст до нормы — 7;
  • другие причины — 1.

7. Фото и публикация

Фото берём из первоисточника и подписываем, откуда оно. Снимки фотобанков и агентств (Getty Images, Shutterstock, AP, Reuters, AFP, Bloomberg, ТАСС, РИА Новости и других) не используем. Если подходящего фото нет, делаем обложку с заголовком. Фото из источника есть у 80 % статей. Все источники перечислены в конце каждой статьи — любую новость можно проверить самостоятельно.

Цифры считаются автоматически по данным редакционной системы за последние 30 дней и обновляются после каждой публикации. Сейчас в очереди 2 события, ещё 124 устарели, не дождавшись своего слота.

Нашли ошибку?

Система проверяет факты, но ошибиться может любой. Если вы нашли неточность — напишите нам, мы исправим.

Правообладателям

Мы ссылаемся на первоисточники и указываем авторов изображений. Если вы считаете, что материал нарушает ваши права, напишите на адрес из раздела «Контакты» — мы рассмотрим обращение и при необходимости удалим материал.