3 мин чтения#ai#llm#engineering

27B на своей карте против 304B по API

Суббота, вечер. Хотел за час выяснить, какую из двух свежих моделей ставить себе. Вышло семь часов и три строки.

МодельБаллtok/sTTFT
Qwen3.8-27B, NVFP4, своя карта0.78959.627.7 с
Qwen3.8-27B, тот же вес по API0.78515.0134.9 с
DeepSeek V4 Flash 0731, по API0.73153.316.0 с

Первые две строки — одна и та же модель, один и тот же вес. Отличается только то, где он выполняется. Разница в балле 0.004, то есть шум. Разница в задержке — почти пятикратная.

Замер соврал, и виноват был я

Вторую строку я прочитал как приговор модели: 134 секунды до первого токена, 1.79 ₽ за решённую задачу — худшая строка на всей доске. Списал на то, что у Qwen3.8-27B единственная точка с нулевым хранением данных, значит приватность вот столько и стоит.

Пошёл проверять. У модели на весь OpenRouter один провайдер. Выбора, от которого меня отрезал бы ZDR, просто нет — модель вышла два дня назад, её поднял один хостер. Его же публичная статистика: P99 по сквозной задержке 788 секунд, ошибки структурированного вывода 13.45%.

Замер осуждал маршрут, а я услышал приговор весам.

Судья придумал галлюцинацию

Одна задача получила 2 из 10 с формулировкой: «галлюцинация несуществующих моделей Qwen3-30B-A3B и Qwen3-32B». Обе существуют. Вторую я месяц назад гонял через этот же харнесс.

Перепроверил на том же сохранённом тексте: gemini снова 2, gpt-5.1 — 9, opus-4.8 — 8. Семь пунктов разброса на одном и том же ответе. Воспроизводимость самого gemini — 0.014, значит ошибка стабильная, а не случайная: она повторится на каждом прогоне этой задачи.

Убери эту одну задачу — и одиночный судья, и ансамбль дают ровно 0.767. Ансамбль не правит перекос. Он ловит редкий провал, который одиночный судья не в состоянии заметить изнутри себя.

DeepSeek я не поставлю

304 млрд параметров, чекпойнт 166.9 ГБ, KV при FP8 — 43 КиБ на токен. На двух картах по 96 ГБ после служебного резерва остаётся 4.46 ГБ под 32K контекста; 256K уже не помещается. Q4 экономит 11.9 ГБ — почти ничего.

И это хорошая модель. На таблице Artificial Analysis у неё 52 против 38 у Qwen3.6-27B. Просто на моих задачах она отстала от модели в одиннадцать раз меньше, а лишних 96 гигабайт я у себя не наблюдаю. Отказ по геометрии, не по качеству.

Оговорка

Один прогон на ветку. Разрыв 0.058 — это 1.35 моего же инструментального разброса. Сигнал, не доказательство. Ветки не сведены по одной переменной: разные кванты, разные движки.

Независимого сравнения этих двух моделей я на публичных досках не нашёл. Если у кого-то есть — покажите, сверю со своим.

Читать по теме