Гайды

Как пользоваться ИИ: инструкции и разборы

Вчера

Как выбрать LLM для рабочих задач: опыт с Claude, GPT и Gemini

Руководитель ИИ-проектов Игорь Зуриев рассказал, как выбирать LLM для рабочих задач. Он предлагает оценивать модели не по бенчмаркам, а по трём критериям: результат, объём ручных правок и проверяемость.

2 минДля профи
30 сентября

Ollama против llama.cpp: сравнили запуск Gemma 4 на сервере

Автор развернул Gemma 4 26B A4B в Q4-кванте на облачном сервере с RTX 4090 и запустил её двумя способами — через Ollama и напрямую через llama.cpp. Он описал установку, настройку HTTP API и подготовку к замерам скорости.

2 минДля профи

Шесть сервисов с бесплатным доступом к Claude и GPT без карты

Автор на Хабре собрал подборку из шести сервисов, где можно получить доступ к топовым моделям вроде Claude и GPT без привязки банковской карты. Часть площадок выдаёт стартовые кредиты, часть — суточные лимиты токенов.

3 минДля профи
26 сентября

Почему нельзя отдавать 100% мышления ИИ: ловушка слепого доверия

На Хабре вышла статья о том, как делегирование ИИ-ассистентам не только рутины, но и самого процесса мышления ведёт к потере профессиональных навыков. Автор приводит три кейса: senior, DevOps и data scientist, которые разучились работать без подсказок модели.

2 мин

Как собрать семантику проекта для кодового агента: четыре файла вместо Confluence

Кодовый агент уверенно находит файл, меняет не тот счётчик и отчитывается о завершении задачи. Проблема не в модели, а в отсутствии переданного намерения. Разбор практики SDD для небольших проектов: четыре коротких файла, которые дают агенту рабочую модель репозитория.

5 минДля профи

Маршрутизация ИИ-моделей: зачем одной модели недостаточно

Для разных задач нужны разные ИИ-модели: одни быстрее и дешевле, другие точнее в анализе или кодинге. Маршрутизация помогает распределять запросы между моделями, чтобы не платить за избыточную мощность.

2 минДля профи

Qwen3.8–27B на двух RTX 3060 ускорили с 9 до 40 токенов/с

Энтузиаст разогнал локальную Qwen3.8–27B Q4 на двух RTX 3060 12 ГБ с 9 до 39,6 токенов/с в реальной сессии OpenCode при контексте 128K. Ключевым изменением стал переход с распределения по слоям на тензорное распараллеливание в llama.cpp.

2 минДля профи

Семь ошибок в оценке AI-агентов: тесты зелёные, а прод ломается

Tech Lead Сергей Прощаев описал семь ошибок в eval-обвязке AI-агентов, из-за которых тесты показывают успех, а о деградации команда узнаёт от поддержки. Главная причина — проверка финального текста вместо состояния системы.

2 минДля профи

Агенты в Claude Code: как устроены и как настроить своих

В Claude Code разобрали механику агентов: изоляция контекста, параллельный запуск и настройка постоянных агентов через файлы в ~/.claude/agents/. На живой задаче четыре агента параллельно разобрали 13 статей за 30 минут.

3 минДля профи

Магнит рассказал, как задеплоил векторный поиск на Triton без GPU

Ведущий ML-разработчик Магнита Стас Чернышев описал, как команда поиска MAGNIT OMNI задеплоила векторный поиск на NVIDIA Triton Inference Server без GPU. Python оставили только для токенизации, а тело модели вынесли в ONNX.

3 минДля профи
25 сентября

GEO: как попасть в рекомендации нейросетей вместо поисковой выдачи

Нейросети всё чаще отвечают на вопросы «кого выбрать», формируя готовую рекомендацию вместо списка ссылок. Разбираем, как работает generative engine optimization и какие шаги помогают бизнесу попасть в ответы ИИ.

3 мин