Хост завис в первую же ночь. Два дня спустя — приватный ИИ, который экономит ₽75 500 в месяц

Первая же ночь с новой картой — хост встал колом. Не завис процесс — весь физический сервер: пинг живой, SSH мёртвый, консоль не отвечает. ₽65 тысяч за Tesla V100 32GB с Авито, и в первые же часы она чуть не забрала с собой шесть работающих сервисов на этой же машине.

Начал копать. За два дня нашёл и починил пять вещей — от разгона до финансов.

Первая: два кабеля питания одновременно — и всё

Карта питается от двух отдельных разъёмов. Если оба включить сразу в момент холодного старта — хост зависает намертво. Продавец потом сам признался: у него было то же самое. Развёл включение по очереди, прогнал полный цикл заново — холодная перезагрузка, обе видеокарты под нагрузкой одновременно, формальная диагностика. Всё чисто. Больше не повторилось.

Вторая: задержка ответа — не там, где искал

Модель отвечала честно, но до первого слова проходило 28 секунд — в шесть раз дольше облачной подписки. Первая мысль — узкая шина передачи данных внутри платы. Проверил цифры: связи с длиной запроса почти нет, зато с временем, которое модель тратит на размышление до ответа, — почти полная. Задержка была не в железе. Модель думала слишком долго вслух, прежде чем начать печатать ответ.

Третья: ограничение размышления сработало наполовину

Поставил лимит — 2048 токенов на размышление. Худшие случаи упали на 85% (227 секунд стало 34). Но по всем задачам, не только по худшим, типичное время ответа выросло на 13%. Модели дали явный бюджет — она стала расходовать его целиком вместо того, чтобы иногда останавливаться раньше сама. Лучше худший случай, чуть хуже средний. Понятный компромисс, не бесплатный подарок.

Четвёртая: память была настроена на старый объём хоста

Заодно добавил памяти — с 64 до 128 гигабайт. И нашёл: кэш диска был закреплён на старом лимите ещё с тех пор, когда в машине было вдвое меньше памяти. Диск задыхался, хотя половина новой памяти простаивала без дела. Поднял лимит кэша — диск сразу успокоился.

Пятая: деньги тоже сошлись

Карта плюс память — ₽154 тысячи разово, поверх уже потраченных ₽284 тысяч на саму машину. Против аренды похожей мощности — ₽75 500 в месяц, без остановки, без права собственности. Окупаемость — 6–7 месяцев.

Та же неделя: глава Anthropic публично попросил всю индустрию притормозить разработку моделей — безопасность не поспевает за скоростью. OpenAI приостановил продажу самого дорогого тарифа в те же дни — не хватило мощностей под новую модель. Это не диагноз обвала облачного ИИ, а сигнал: мощность становится дефицитом раньше прогнозов. Цены на память и видеопамять выросли на 355–500% за год — купить сейчас оказалось вовремя.

Оценка модели против облачной подписки94% и 92% на двух прогонах
Задержка худшего случая−85%
Разовые вложения₽438 тысяч
Экономия против аренды₽75 500 / месяц
Окупаемость6–7 месяцев

Что вынес:

→ Железо ломается по мелочи, которую продавец знает и не всегда говорит сразу — спросить прямо стоило раньше → Ограничение — не бесплатный выигрыш, у него есть цена на типичном случае, и её стоит замерить, а не считать очевидной → Настройки, посчитанные под старое железо, не обновляются сами — апгрейдишь одно, проверь всё, что от него зависело → Приватный ИИ дома перестаёт быть хобби, когда цифры сходятся сами — и они сошлись раньше, чем планировал

Читать по теме