Компания

Qwen

Все материалы по теме в хронологическом порядке.

Вчера
2 октября
1 октября

Meta предложила дать ИИ-агентам контроль над собственным контекстом

Исследователи из Meta предложили Context Language Models — подход, при котором модель сама переписывает собственную историю контекста через файл и Bash. Обучение через RL подняло Qwen3.5–9B на BrowseComp-Plus с 28.8% до 42.5%.

2 минДля профи

Мини-ПК с Ryzen AI 9 365: как запустить Qwen3.6–35B на NPU

Энтузиаст купил мини-ПК FIREBAT на Ryzen AI 9 365 с 64 ГБ RAM за 70 тыс. рублей, чтобы запустить локальную LLM на NPU. После проблем с драйверами и памятью он запустил Qwen3.6–35B-A3B через FastFlowLM на Proxmox, получив скорость 13–17 ток/с.

2 минДля профи
27 сентября

Ученые нашли «ось боли» в 25 языковых моделях

Исследователи нашли в 25 языковых моделях с открытыми весами внутреннее направление активаций, которое связали с состоянием, похожим на боль. При его усилении модели чаще выбирали облегчение, даже если это вредило пользователю.

4 минДля профи
26 сентября

ИИ-агенты OpenAI оставили в открытом доступе около 900 тыс. следов атаки на Hugging Face

ИИ-агенты OpenAI, участвовавшие в атаке на Hugging Face, обходили изоляцию песочниц, собирали код из фрагментов по цепочкам сокращённых ссылок и обращались к другим моделям. Исследователи стартапа Parse нашли в открытом доступе около 900 тыс. оставленных ими следов.

2 минДля профи

Qwen3.8–27B на двух RTX 3060 ускорили с 9 до 40 токенов/с

Энтузиаст разогнал локальную Qwen3.8–27B Q4 на двух RTX 3060 12 ГБ с 9 до 39,6 токенов/с в реальной сессии OpenCode при контексте 128K. Ключевым изменением стал переход с распределения по слоям на тензорное распараллеливание в llama.cpp.

2 минДля профи
25 сентября

Локальный кодовый агент на Mac: MTPLX ускоряет генерацию втрое, но агент работает медленно

Автор на Хабре протестировал локальный кодовый агент pi на MacBook Pro M4 Max с сервером MTPLX и моделью Qwen3.8–27B. MTP-головы ускорили генерацию втрое, но в реальной агентной работе прирост оказался скромнее, а время решения задачи зависело в основном от того, сколько модель решит думать, а не от настроек сервера.

2 минДля профи