2-битный DeepSeek, Ornith-35B и ошибка в собственном замере

В прошлый раз сравнил Qwen3.8-27B на своей карте с DeepSeek V4 Flash по API — 0.789 против 0.731. Дальше — очевидный вопрос: а если DeepSeek поставить на ту же карту, урезав до 2 бит?

МодельБаллПрошлоток/с
Qwen3.8-27B, NVFP4, своя карта0.78946/5056-59
DeepSeek V4 Flash, по API, полная точность0.73142/5053.3
Ornith-35B (MoE), своя карта, впервые измерен0.72942/50236.5
DeepSeek V4 Flash, IQ2_XXS, своя карта0.69735/5066.8
Ornith-9B, своя карта, впервые измерен0.62831/50123.6

Два бита стоят реальных денег в баллах — минус 0.034 против той же модели по API на полной точности. Судьи цитируют конкретное: выдуманные цифры производительности несуществующих связок, рекомендация квантования, которая прямо противоречит условию задачи. Ровно то, чего ждёшь от 2-битного сжатия — страдает точность, не связность. При этом DeepSeek честно хорошая модель на своей полной точности — 304 млрд параметров, 13 активных, MIT — просто держать две карты по 96 ГБ ради 32K контекста я себе позволить не готов.

Заявил победу — а сам ошибся в замере

Первый прогон я оценил одним судьёй и получил 0.681 — выше, чем любая локальная конфигурация Qwen на тот момент. Написал: «локальная модель обходит всё, что мы можем себе позволить».

Ошибку словил не я. «Мы уверены в цифрах?» — сравнил составы судей и увидел: все прошлые замеры шли на ансамбле из трёх (gemini + gpt-5.1 + opus-4.8), мой — на одном gemini. Разные судьи — разные шкалы, сравнивать нельзя. Пересчитал на том же ансамбле: 0.697. А лучший локальный Qwen — не 0.628 из старой таблицы, а 0.789 из более позднего прогона, который я просто не поднял из архива. Заголовок развернулся на 180 градусов за один вечер.

Второй раунд замера принёс отдельный сюрприз: часть задач вернулась с PermissionDeniedError от всех трёх судей разом. Не лимит запросов в секунду — баланс аккаунта на OpenRouter, три с половиной доллара осталось из четырёхсот шестидесяти. Поле с лимитом ключа при этом показывало запас в семьдесят с лишним — решает не оно.

Модель, которую я не мерил полгода

Ornith-35B (MoE, активных параметров на токен около трёх) не участвовала в этом бенче раньше — просто руки не доходили. Результат: 0.729 против 42 из 50 задач — ровно то же число прошедших, что у DeepSeek по API на полной точности, — при декоде в 4.4 раза быстрее. До замены Qwen3.8 в продакшене не дотягивает, но это первая цифра, которую вообще стоит держать в уме при следующем выборе модели.

Оговорка

Один прогон на конфигурацию — тот же разброс, что и в прошлый раз. Задача bash-002 упала с одним и тем же кодом выхода на обеих моделях Ornith — вероятно, дефект самой задачи (grep без совпадений завершается кодом 1, это не ошибка), не модели. Не проверял.

Читать по теме