Clef-flash Ollama
Decision model vs LLM · локальный сервер

Введите животное — две модели по-разному выберут подходящий узел

Обе модели получают одинаковые вводные: одни и те же узлы с одними и теми же описаниями. Разница только в формате — Clef-flash получает их как типизированную схему и возвращает калиброванные вероятности без генерации текста, а LLM из Ollama — как промпт роутера перед запросом в RAG. Под каждой моделью видно, что именно в неё уходит, сколько заняла загрузка и сам ответ, и целиком ли модель работала на GPU.

01 · Запросреальные модели
02 · Узлы и описанияобщие для обеих
03 · Модель Ollama
перед ответом другие модели выгружаются с GPU, чтобы выбранной хватило видеопамяти — замеры по времени честнее

Сравниваем с Clef-flash (9B) — decision-моделью Cloudflare, запущенной локально на этом же сервере: она получает те же узлы как типизированную схему и отвечает вероятностями без генерации текста. Модели Ollama подставляются автоматически, подключать ничего не нужно.

Результаты
Clef-flash DECISION MODEL · ЛОКАЛЬНО · 9B
Те же узлы и описания — как типизированная схема (state + questions + criteria). Возвращает только вероятности, без генерации текста.
ждёт запроса
Что уходит в модель

        
Что пришло в ответ

        
Ollama LLM · АВТОРЕГРЕССИОННАЯ
Те же узлы и описания — как промпт роутера перед RAG. Генерирует JSON-ответ токен за токеном.
ждёт запроса
Что уходит в модель

        
Что пришло в ответ

        
Clef-flash выбрал
—
Ollama выбрал
—
Быстрее (время ответа)
—
Совпадение
—