GPT-5.6 Luna стоит в 10 раз дешевле Claude Sonnet 5 — и набрал ровно столько же
В четверг вечером сделал то, что откладывал две недели: взял свой замер — 50 задач, стратегия, архитектура, документы, ресерч, подготовка к сделкам, то, чем я реально занят по будним дням — и прогнал его через весь диапазон закрытых моделей, от самого дорогого тарифа до самого дешёвого, и сравнил с тем, что крутится у меня дома, на своей карте.
Три дня ушло не на замер — на то, чтобы поверить собственным цифрам.
Таблица целиком:
| Модель | Балл |
|---|---|
| GPT-5.6 Sol | 0.870 |
| Claude Sonnet 5 | 0.842 |
| GPT-5.6 Luna | 0.842 |
| GPT-5.6 Terra | 0.841 |
| Claude Fable 5 | 0.822 |
| Claude Opus 5 | 0.818 |
| Flash-Next, своя карта, лучший квант | 0.786 |
| Qwen3.8-27B, своя карта, боевая версия | 0.769 |
| Ornith-35B, своя карта | 0.732 |
| Ornith-9B, своя карта, компактная | 0.590 |
Первое, что бросается в глаза: GPT-5.6 Luna — самый дешёвый тариф из шести, в 10 раз дешевле Claude Sonnet 5 по цене за токен — набрал ровно столько же баллов. За качество здесь переплачивать не за что.
Второе: Claude Fable 5 чуть не попал в заметку как аутсайдер. Я сам вручную перепроверял его цифру перед публикацией — что-то в ней не билось. Оказалось, цифра была битая: не модель ответила плохо, а часть судей молча упала под нагрузкой и вернула ноль вместо реальной оценки. Один прогон — 2 из 3 судей отвалились, реальный ответ был на 10 из 10 у выжившего судьи, а битая усреднённая оценка стояла 0.333. После починки Fable 5 переехал с последнего места на середину таблицы. Урок на будущее: если под замером падает инфраструктура, она может соврать не только вверх — но и вниз, а низкий балл при этом выглядит совершенно правдоподобно сам по себе.
Третье — и это то, ради чего заметка вообще пишется. Две модели, каждая на своей, совершенно безобидной задаче, отказались отвечать.
Claude Fable 5 получил на вход обычный конфиг — порт, таймаут, имя модели эмбеддера, ничего секретного, зачищенный тестовый файл. Ответ: пустота, content_filter.
Claude Opus 5 получил задачу написать функцию транслитерации русских имён — ж→zh, ч→ch, ш→sh. Начал нормально, дописал докстринг, начал таблицу транслитерации — и оборвался на полуслове с тем же content_filter.
Ни то, ни другое не похоже на реальный риск. Похоже на то, что классификатор безопасности иногда режет не опасный текст, а текст, который просто выглядит непривычно — конфиг с портами, кириллица в середине генерации.
Итог для себя: платить за самую дорогую модель здесь не за что — дешёвый тариф не хуже. Своя модель на своей карте отстаёт заметно, но не катастрофически — на 0.08–0.09 балла от лучшей закрытой, и это реальный разрыв, не шум измерения. А самое интересное в замере в этот раз оказалось не про качество моделей вообще — а про то, что даже топовые модели иногда молча отказывают там, где отказывать не от чего.