Заметки с тегом
#llm
18 записей
- 3 мин чтения
GPT-5.6 Luna стоит в 10 раз дешевле Claude Sonnet 5 — и набрал ровно столько же
Прогнал свой замер через шесть закрытых моделей и четыре свои — и два случая, когда топовые модели молча отказали на совершенно безобидных задачах.
- 4 мин чтения
Qwen3.8-Flash-Next против прод-27B за три прогона: 0.789 был не тот конфиг
Новая архитектура Qwen4 против продакшн-27B на трёх прогонах — и почему прошлый пост цитировал не тот конфиг.
- 3 мин чтения
2-битный DeepSeek, Ornith-35B и ошибка в собственном замере
Три модели, которые я раньше не гонял на своём бенче, и ошибка в замере, которую поймал не я.
- 3 мин чтения
18 квантов на одной карте: втрое быстрее — не значит умнее
Прогнал 18 конфигураций трёх моделей на арендованной карте. Получил таблицу под любой размер видеопамяти — и один дефект, который вендорский бенч не показал.
- 4 мин чтения
Больше памяти — не значит быстрее: prefill, decode и релиз Apple M5 Ultra
Apple выпустила M6 и M5 Ultra. Разбираю на roofline-модели и реальных цифрах, почему prefill и decode упираются в разное железо — и кому 512 ГБ единой памяти реально нужны.
- 2 мин чтения
Claude Enterprise: администратор видит всё, даже удалённые чаты
Тред на Reddit подтвердил: администратор Claude Enterprise видит переписку сотрудника целиком, включая удалённые и инкогнито-чаты. Вопрос не в баге — в архитектуре.
- 3 мин чтения
27B на своей карте против 304B по API
50 задач, три судьи, две модели. Меньшая выиграла — но сначала я неправильно прочитал собственный замер.
- 4 мин чтения
Сторонний NVFP4 против официального FP8 на Qwen3.8-27B: 1.35× быстрее
Мой NVFP4-чекпойнт (unsloth) быстрее официального FP8 в 1.35 раза на Qwen3.8-27B, backend-controlled. Качество — открытый вопрос, и по пути поймал себя на двух поспешных выводах.
- 2 мин чтения
Водяные знаки в текстах Claude: сигнал, а не доказательство
Anthropic будет помечать тексты Claude невидимыми водяными знаками. Что знак говорит на самом деле — и почему настоящий вопрос не в знаке, а в контуре.
- 1 мин чтения
Одна модель, два контура: своё железо и облако
Стали партнёром Yandex Cloud. Один Qwen3.6, два контура доставки — своё железо в Selectel и облако через Yandex Cloud API. Оба по 152-ФЗ.
- 4 мин чтения
Русский опенсорс на своём Blackwell — и где ломается NVFP4
Лестница открытых RU-моделей на RTX PRO 6000: плотная 27B взяла верх, 12B в полушаге при вдвое меньшем размере, а NVFP4 на Blackwell завёлся не для всех.
- 2 мин чтения
Починил NVFP4 на Blackwell — не хватало CUDA 12.9
Два бага на Blackwell оказались одним пробелом в CUDA-тулките, не багом vLLM. Обе модели теперь работают в NVFP4, память — на 4-5 ГБ больше расчёта.
- 3 мин чтения
DeepSeek V4 Flash на ЛИИ-Архитектор-Bench-RU: 0.717 и ₽0.022 за задачу
DeepSeek V4 Flash набрал 0.717 на ЛИИ-Архитектор-Bench-RU: дешевле V4-Pro, ниже топ-3, но впервые реален для 2×RTX PRO 6000.
- 2 мин чтения
Ставка на скучный ИИ: фронтир пришёл к тому, что я строю
Я выбрал проверяемый ИИ — по корпусу, со ссылкой, с честным отказом — когда это звучало как ниша. Пересмотрел десятки главных ИИ-интервью года: фронтир описывает ровно эту ставку. И теперь у меня есть то, чего нет у голосов со сцены, — цифра.
- 2 мин чтения
Полный разворот: модель — это вызов API
Полный разворот: модель — это вызов API за копейки. Два контура — публичный на CPU и суверенный на месте. Преимущество — в слое поверх модели.
- 2 мин чтения
Выбрал модель под железо, которое есть
Выбирал модель для «Доверенного ИИ» под 24 ГБ. Замер оказался умнее интуиции: MoE обошла плотную модель вдвое крупнее, «thinking» только мешал.
- 7 мин чтения
Доверенный ИИ на практике: RAG, который ссылается на источник — или честно отказывается
Собрал за выходные RAG, который отвечает строго по корпусу и к каждому утверждению ставит ссылку на пункт — или честно отказывается. Локально на Gemma-4, ни одного внешнего вызова на инференсе. Стек, баги и цифры.
- 4 мин чтения
Семь LLM против русского спортивного домена
Прогнал семь моделей через ЛИИ-Спорт-Bench-RU. Frontier-модели выигрывают по сырому счёту, но базой ЛИИ-Спорт всё равно остаётся Gemma 4 31B.