3 мин чтения#ии#бенчмарк#llm

GPT-5.6 Luna стоит в 10 раз дешевле Claude Sonnet 5 — и набрал ровно столько же

В четверг вечером сделал то, что откладывал две недели: взял свой замер — 50 задач, стратегия, архитектура, документы, ресерч, подготовка к сделкам, то, чем я реально занят по будним дням — и прогнал его через весь диапазон закрытых моделей, от самого дорогого тарифа до самого дешёвого, и сравнил с тем, что крутится у меня дома, на своей карте.

Три дня ушло не на замер — на то, чтобы поверить собственным цифрам.

Таблица целиком:

МодельБалл
GPT-5.6 Sol0.870
Claude Sonnet 50.842
GPT-5.6 Luna0.842
GPT-5.6 Terra0.841
Claude Fable 50.822
Claude Opus 50.818
Flash-Next, своя карта, лучший квант0.786
Qwen3.8-27B, своя карта, боевая версия0.769
Ornith-35B, своя карта0.732
Ornith-9B, своя карта, компактная0.590

Первое, что бросается в глаза: GPT-5.6 Luna — самый дешёвый тариф из шести, в 10 раз дешевле Claude Sonnet 5 по цене за токен — набрал ровно столько же баллов. За качество здесь переплачивать не за что.

Второе: Claude Fable 5 чуть не попал в заметку как аутсайдер. Я сам вручную перепроверял его цифру перед публикацией — что-то в ней не билось. Оказалось, цифра была битая: не модель ответила плохо, а часть судей молча упала под нагрузкой и вернула ноль вместо реальной оценки. Один прогон — 2 из 3 судей отвалились, реальный ответ был на 10 из 10 у выжившего судьи, а битая усреднённая оценка стояла 0.333. После починки Fable 5 переехал с последнего места на середину таблицы. Урок на будущее: если под замером падает инфраструктура, она может соврать не только вверх — но и вниз, а низкий балл при этом выглядит совершенно правдоподобно сам по себе.

Третье — и это то, ради чего заметка вообще пишется. Две модели, каждая на своей, совершенно безобидной задаче, отказались отвечать.

Claude Fable 5 получил на вход обычный конфиг — порт, таймаут, имя модели эмбеддера, ничего секретного, зачищенный тестовый файл. Ответ: пустота, content_filter.

Claude Opus 5 получил задачу написать функцию транслитерации русских имён — ж→zh, ч→ch, ш→sh. Начал нормально, дописал докстринг, начал таблицу транслитерации — и оборвался на полуслове с тем же content_filter.

Ни то, ни другое не похоже на реальный риск. Похоже на то, что классификатор безопасности иногда режет не опасный текст, а текст, который просто выглядит непривычно — конфиг с портами, кириллица в середине генерации.

Итог для себя: платить за самую дорогую модель здесь не за что — дешёвый тариф не хуже. Своя модель на своей карте отстаёт заметно, но не катастрофически — на 0.08–0.09 балла от лучшей закрытой, и это реальный разрыв, не шум измерения. А самое интересное в замере в этот раз оказалось не про качество моделей вообще — а про то, что даже топовые модели иногда молча отказывают там, где отказывать не от чего.

Читать по теме