Заметки с тегом
#инфраструктура
10 записей
- 3 мин чтения
0,56 + 0,38 + 0,04 + 0,03 = 1,01
Бюджет видеопамяти для двух моделей на одной карте никогда не сходился — обычный апгрейд vLLM наконец это показал.
- 4 мин чтения
Qwen3.8-Flash-Next против прод-27B за три прогона: 0.789 был не тот конфиг
Новая архитектура Qwen4 против продакшн-27B на трёх прогонах — и почему прошлый пост цитировал не тот конфиг.
- 3 мин чтения
2-битный DeepSeek, Ornith-35B и ошибка в собственном замере
Три модели, которые я раньше не гонял на своём бенче, и ошибка в замере, которую поймал не я.
- 3 мин чтения
18 квантов на одной карте: втрое быстрее — не значит умнее
Прогнал 18 конфигураций трёх моделей на арендованной карте. Получил таблицу под любой размер видеопамяти — и один дефект, который вендорский бенч не показал.
- 4 мин чтения
Больше памяти — не значит быстрее: prefill, decode и релиз Apple M5 Ultra
Apple выпустила M6 и M5 Ultra. Разбираю на roofline-модели и реальных цифрах, почему prefill и decode упираются в разное железо — и кому 512 ГБ единой памяти реально нужны.
- 4 мин чтения
Сторонний NVFP4 против официального FP8 на Qwen3.8-27B: 1.35× быстрее
Мой NVFP4-чекпойнт (unsloth) быстрее официального FP8 в 1.35 раза на Qwen3.8-27B, backend-controlled. Качество — открытый вопрос, и по пути поймал себя на двух поспешных выводах.
- 4 мин чтения
Русский опенсорс на своём Blackwell — и где ломается NVFP4
Лестница открытых RU-моделей на RTX PRO 6000: плотная 27B взяла верх, 12B в полушаге при вдвое меньшем размере, а NVFP4 на Blackwell завёлся не для всех.
- 2 мин чтения
Починил NVFP4 на Blackwell — не хватало CUDA 12.9
Два бага на Blackwell оказались одним пробелом в CUDA-тулките, не багом vLLM. Обе модели теперь работают в NVFP4, память — на 4-5 ГБ больше расчёта.
- 3 мин чтения
DeepSeek V4 Flash на ЛИИ-Архитектор-Bench-RU: 0.717 и ₽0.022 за задачу
DeepSeek V4 Flash набрал 0.717 на ЛИИ-Архитектор-Bench-RU: дешевле V4-Pro, ниже топ-3, но впервые реален для 2×RTX PRO 6000.
- 2 мин чтения
А нужна ли вообще своя видеокарта?
Дефицит видеопамяти, аренда дорожает. Сел выбирать видеокарту — а правильный вопрос оказался в другом: нужна ли она вообще.