Шесть decision-моделей за 16 дней: как устроены Jev, Clef и другие
15 сентября TypeSafe выпустила Jev — первую модель класса System One, которая отвечает на типизированные вопросы за один прямой проход без генерации токенов. За 16 дней появились ещё пять реализаций той же идеи от Cloudflare, Perplexity, AWS, Convai Innovations и Fastino.
- Jev стоит 0,042 доллара за миллион входных токенов, задержка 70–500 мс, контекст 32K токенов.
- Clef и Clef-flash от Cloudflare основаны на замороженных Qwen3.8–27B и Qwen3.5–9B, веса открыты под Apache 2.0.
- Strands Decider 2B от AWS и Laya от Convai Innovations бесплатны при запуске на своём железе.

15 сентября TypeSafe выпустила Jev и назвала её первой моделью класса System One. Модель получает состояние системы и набор типизированных вопросов, а возвращает распределение вероятностей по допустимым ответам. Весь ответ считается за один прямой проход, без генерации токенов.
За 16 дней вышли ещё пять реализаций той же идеи: Clef и Clef-flash от Cloudflare, pplx-decider-v1–27b от Perplexity, Strands Decider 2B от AWS, Laya от Convai Innovations и GLiDE от Fastino. Интерфейс у них почти общий, а внутри пять разных решений: замороженная LLM с обучаемым выходным слоем, LLM с заменённой LM head, pointer-механизм, энкодер на 322 млн параметров и рассуждение, которое включается по требованию.
Зачем агентам отдельная модель
Во многих агентных системах LLM вызывается на каждом шаге, хотя на большинстве шагов текст не нужен. Агент выбирает инструмент, проверяет, закончена ли задача, решает, можно ли выполнять команду. Полная генерация на таком шаге стоит дороже и работает медленнее, чем требует выбор, а ответ ещё приходится парсить и проверять на соответствие формату.
TypeSafe предложила для этих шагов отдельный быстрый контур и назвала его System One, по аналогии с быстрым интуитивным мышлением, которое Канеман назвал Системой 1. Название Jev отсылает к парадоксу Джевонса: чем дешевле ресурс, тем больше его потребляют. Сама Jev стоит 0,042 доллара за миллион входных токенов, TypeSafe заявляет задержку 70–500 мс и контекст 32K токенов.
Интерфейс: состояние и типизированные вопросы
Запрос состоит из двух частей. Состояние (state) — текст или JSON: тикет, страница, трасса агента, история переписки. Вопросы к нему бывают трёх типов: noul (вероятность ответа «да»), choice (один вариант из списка, у Jev до 255 вариантов) и score (уровень на упорядоченной шкале).
В ответе приходит вероятность для каждого допустимого ответа каждого вопроса. Выходных токенов нет, поэтому Jev, Clef и pplx-decider тарифицируют только вход. Несколько вопросов к одному состоянию выгодно отправлять одним запросом: состояние оплачивается один раз. Clef принимает до 64 вопросов за запрос.
Что меняется в архитектуре
В обычной LLM трансформер переводит вход в скрытые состояния, а последний слой, LM head, проецирует вектор последней позиции на словарь из десятков или сотен тысяч токенов. Decision-модель оставляет только prefill. Вместо проекции на словарь стоит выходной слой, который оценивает допустимые варианты, и softmax по ним.
Следствий три: ответы на все вопросы к состоянию считаются за один проход параллельно; ответ всегда входит в допустимое множество, парсить и валидировать нечего; пропускная способность GPU определяется скоростью prefill, а она намного выше скорости генерации.
Шесть моделей в одной таблице
- Jev (TypeSafe) — основа не раскрыта, доступ по API, 0,042 доллара за миллион входных токенов, контекст 32K.
- Clef (Cloudflare) — замороженная Qwen3.8–27B плюс LoRA, API и веса под Apache 2.0, 0,24 доллара, контекст 64K.
- Clef-flash (Cloudflare) — замороженная Qwen3.5–9B плюс LoRA, API и веса под Apache 2.0, 0,09 доллара, контекст 64K.
- pplx-decider-v1–27b (Perplexity) — переобученная Qwen3.8–27B на 26,1 млрд параметров, фиксированный выход на 255 решений, API и веса под Apache 2.0, 0,042 доллара, контекст 62K.
- Strands Decider 2B (AWS) — Qwen3.5–2B плюс LoRA на 1,9 млрд, pointer-head примерно на 1 млн параметров, веса под Apache 2.0, бесплатно на своём железе.
- Laya (Convai Innovations) — ModernBERT на 421 млн или mmBERT на 322 млн, маркер [MASK] на каждый вариант, веса под Apache 2.0, бесплатно на своём железе.
- GLiDE (Fastino) — основа не раскрыта, быстрый проход с рассуждением при неуверенности, API, 0,30 доллара включая токены рассуждения, контекст 40K.
Clef и Clef-flash
Cloudflare оставила базовую модель нетронутой: у Clef это замороженная Qwen3.8–27B, у Clef-flash Qwen3.5–9B. Обучаются LoRA-адаптеры и отдельный механизм маршрутизации внимания между вариантами. После prefill выходной слой оценивает все варианты параллельно. Визуальный энкодер Qwen сохранён, поэтому обе модели принимают до четырёх картинок за запрос.
Веса открыты под Apache 2.0 и запускаются через Transformers, vLLM или SGLang. В Workers AI модели стоят 0,24 и 0,09 доллара за миллион входных токенов при контексте 65 536 токенов. По тестам Cloudflare, Clef или Clef-flash первые в 7 из 10 decision-бенчмарков. На BANKING77 Clef обходит Jev на 14,5 пункта (94,2 против 79,7), а на When2Call проигрывает 8,6.
Для профиТехнические детали: архитектура, цифры, ссылки
Архитектура. Decision-модель оставляет только фазу prefill трансформера. Вместо LM head стоит выходной слой, оценивающий допустимые варианты, и softmax по ним. Ответы на все вопросы к одному состоянию считаются за один проход параллельно.
Типы вопросов. noul — вероятность ответа «да»; choice — один вариант из списка (у Jev до 255 вариантов); score — уровень на упорядоченной шкале. Clef принимает до 64 вопросов за запрос.
Цены и контекст. Jev — 0,042 доллара за 1 млн входных токенов, 32K. Clef — 0,24, 64K. Clef-flash — 0,09, 64K. pplx-decider-v1–27b — 0,042, 62K. GLiDE — 0,30 включая токены рассуждения, 40K. Strands Decider 2B и Laya — бесплатно на своём железе.
Лицензии. Clef, Clef-flash, pplx-decider-v1–27b, Strands Decider 2B и Laya открыты под Apache 2.0. Jev и GLiDE доступны только по API.
Бенчмарки. По тестам Cloudflare, Clef или Clef-flash первые в 7 из 10 decision-бенчмарков. На BANKING77 Clef обходит Jev на 14,5 пункта (94,2 против 79,7), на When2Call проигрывает 8,6. LangChain сравнила Jev с тремя LLM в роли судьи на 500 оценках: совпадение Jev с оценкой человека — 100% при цене 0,00035 доллара и времени 0,44 с; GPT-5.6 Terra — 99,8% при 0,00289 и 2,83 с; GPT-5.6 Luna — 96,4% при 0,00039 и 2,50 с; Claude Sonnet 4.6 — 80,0% при 0,0281 и 12,16 с.
Совместимость. Cloudflare называет Clef полностью совместимой с API Jev. Fastino отдаёт GLiDE через тот же эндпоинт /v1/systemone и публикует гайд по миграции с TypeSafe.
Вопросы и ответы
- Что такое decision-модель?
- Модель, которая получает состояние системы и типизированные вопросы, а возвращает распределение вероятностей по допустимым ответам за один прямой проход, без генерации токенов.
- Сколько стоит Jev?
- 0,042 доллара за миллион входных токенов. Задержка 70–500 мс, контекст 32K токенов.
- Какие decision-модели открыты под Apache 2.0?
- Clef, Clef-flash, pplx-decider-v1–27b, Strands Decider 2B и Laya. Jev и GLiDE доступны только по API.


