2-битный DeepSeek, Ornith-35B и ошибка в собственном замере
В прошлый раз сравнил Qwen3.8-27B на своей карте с DeepSeek V4 Flash по API — 0.789 против 0.731. Дальше — очевидный вопрос: а если DeepSeek поставить на ту же карту, урезав до 2 бит?
| Модель | Балл | Прошло | ток/с |
|---|---|---|---|
| Qwen3.8-27B, NVFP4, своя карта | 0.789 | 46/50 | 56-59 |
| DeepSeek V4 Flash, по API, полная точность | 0.731 | 42/50 | 53.3 |
| Ornith-35B (MoE), своя карта, впервые измерен | 0.729 | 42/50 | 236.5 |
| DeepSeek V4 Flash, IQ2_XXS, своя карта | 0.697 | 35/50 | 66.8 |
| Ornith-9B, своя карта, впервые измерен | 0.628 | 31/50 | 123.6 |
Два бита стоят реальных денег в баллах — минус 0.034 против той же модели по API на полной точности. Судьи цитируют конкретное: выдуманные цифры производительности несуществующих связок, рекомендация квантования, которая прямо противоречит условию задачи. Ровно то, чего ждёшь от 2-битного сжатия — страдает точность, не связность. При этом DeepSeek честно хорошая модель на своей полной точности — 304 млрд параметров, 13 активных, MIT — просто держать две карты по 96 ГБ ради 32K контекста я себе позволить не готов.
Заявил победу — а сам ошибся в замере
Первый прогон я оценил одним судьёй и получил 0.681 — выше, чем любая локальная конфигурация Qwen на тот момент. Написал: «локальная модель обходит всё, что мы можем себе позволить».
Ошибку словил не я. «Мы уверены в цифрах?» — сравнил составы судей и увидел: все прошлые замеры шли на ансамбле из трёх (gemini + gpt-5.1 + opus-4.8), мой — на одном gemini. Разные судьи — разные шкалы, сравнивать нельзя. Пересчитал на том же ансамбле: 0.697. А лучший локальный Qwen — не 0.628 из старой таблицы, а 0.789 из более позднего прогона, который я просто не поднял из архива. Заголовок развернулся на 180 градусов за один вечер.
Второй раунд замера принёс отдельный сюрприз: часть задач вернулась с PermissionDeniedError от всех трёх судей разом. Не лимит запросов в секунду — баланс аккаунта на OpenRouter, три с половиной доллара осталось из четырёхсот шестидесяти. Поле с лимитом ключа при этом показывало запас в семьдесят с лишним — решает не оно.
Модель, которую я не мерил полгода
Ornith-35B (MoE, активных параметров на токен около трёх) не участвовала в этом бенче раньше — просто руки не доходили. Результат: 0.729 против 42 из 50 задач — ровно то же число прошедших, что у DeepSeek по API на полной точности, — при декоде в 4.4 раза быстрее. До замены Qwen3.8 в продакшене не дотягивает, но это первая цифра, которую вообще стоит держать в уме при следующем выборе модели.
Оговорка
Один прогон на конфигурацию — тот же разброс, что и в прошлый раз. Задача bash-002 упала с одним и тем же кодом выхода на обеих моделях Ornith — вероятно, дефект самой задачи (grep без совпадений завершается кодом 1, это не ошибка), не модели. Не проверял.