Kimi K3: реальная стоимость открытых весов и требования к GPU

Команда из пяти человек в среднем российском медиапроекте посмотрела на новую модель Kimi K3, чтобы понять, сможет ли она ускорить генерацию новостных резюме.
Факт — китайская модель заявляет о «открытых весах» и о том, что её можно использовать без стоимости лицензий, но для полноценной работы её требуется размещать на десятках видеокарт GPU.
Последствие — скрытые затраты на оборудование, электроэнергию и обслуживание могут превзойти цену облачного API, о чём многие забывают, планируя бюджет.
Что проверить — сколько видеокарт реально понадобится, какова цена их аренды/покупки, какая часть расходов придётся отнести к энергии и обслуживанию, прежде чем выбрать между self‑hosting и облачным сервисом.

Источник: perplexity.ai

Что изменилось в сравнении открытых и облачных моделей?

  • Открытые веса — не автоматически дешёвая альтернатива. Раньше их рекламировали как «билет в мир ИИ без постоянных счётов», но Kimi K3 показывает, что «открытость» теперь часто означает «можно самому подсчитать, почему счёт получился таким».
  • Размер модели растёт, а значит растут и требования к железу. Для запуска Kimi K3 потребуется от 50 до 70 GPU (в зависимости от настроек), что уже выходит за рамки типичной «домашней» инфраструктуры.
  • API‑подключение сохраняет предсказуемость расходов. Поставщик берёт плату за токен или за запрос, а стоимость вычислительных ресурсов уже включена в цену.

Таким образом, главный переход — от обещанной экономии к необходимости расчёта реальных расходов на инфраструктуру.

Какие данные мы видим в источнике?

* «Kimi K3 занимает первое место в одном рейтинге, обещает быть открытой и заметно дешевле американских моделей — но бюджеты всё ещё существуют» [источник 1].
* «Открытые веса долго продавали как билет в мир, где ИИ можно взять подешевле… но Kimi K3 слегка портит эту сказку: модель огромная, запускать её нужно на десятках GPU, а API уже не выглядит благотворительностью» [источник 2].

Эти два фрагмента показывают, что открытость модели не устраняет расходы, а только меняет их характер: от лицензий к инфраструктуре.

Как сравнить варианты без шума

  1. Определите базовый объём запросов.
    Спросите у команды, сколько токенов/запросов в месяц потребуется (пример — 10 млн токенов).
  2. Сложите стоимость видеокарт.
    Покупка: одна современная A100 стоит ≈ 200 000 ₽. При 60 картах — 12 млн ₽ единовременно.
    Аренда в облаке: около 3 000 ₽ / GPU / мес., значит ≈ 180 000 ₽ в месяц.
  3. Учтите электроэнергию и охлаждение.
    Один GPU потребляет ≈ 300 Вт; при 60 картах — ≈ 18 кВт·ч. При цене электроэнергии 5 ₽/кВт·ч это 90 ₽ в час, ≈ 2 050 ₽ в мес.
  4. Добавьте затраты на персонал.
    Поддержка такой инфраструктуры требует хотя бы одного системного администратора (≈ 150 000 ₽ / мес.) и инженера‑исследователя (≈ 200 000 ₽ / мес.).
  5. Сравните с ценой API.
    Средняя стоимость облачного API для сопоставимых моделей ≈ 0,02 ₽ за 1000 токенов. При 10 млн токенов это ≈ 200 ₽ в мес., плюс минимальный тариф за доступ ≈ 5 000 ₽ в мес.
Показатель Self‑hosting (≈ 60 GPU) Облачный API
Начальные затраты 12 млн ₽ (покупка) / 0 ₽ (аренда) 0 ₽
Ежемесячные расходы (GPU) 180 000 ₽ (аренда) включено
Энергия + охлаждение ≈ 2 000 ₽
Персонал (минимум) ≈ 350 000 ₽
Стоимость запросов (10 млн токенов) ≈ 200 ₽
Итоговые ежемесячные расходы ≈ 532 000 ₽ ≈ 5 200 ₽

Эти цифры показывают, что даже при аренде GPU само‑хостинг обходится в разы дороже, чем облачный API, если только не использовать модель в экстенсивных масштабах.

Где скрыты ограничения и риски?

Риск / ограничение Self‑hosting Облачный API
Доступ к нужному железу Нужно обеспечить 60‑+ GPU, возможны очереди в дата‑центрах Поставщик гарантирует доступ, но может менять тариф
Санкции и ограничения импорта При покупке оборудования в китайских/западных фирмах могут возникнуть проблемы Оплата через международные карты может блокироваться
Обслуживание и обновления Требуется команда, риск простоев, необходимость патчей Обновления автоматически интегрированы
Масштабирование выше 60 GPU После 64‑й видеокарты экспоненциальный рост сложности Поставщик обычно предлагает гибкое масштабирование
Прозрачность расходов Нужно вести учёт всех статей вручную Прозрачная модель «платишь‑за‑использование»
Надёжность и SLA Зависит от собственного дата‑центра Договорные SLA от провайдера

Эти контрасты помогают понять, в каких сценариях self‑hosting может быть оправдан, а где лучше оставить всё в облаке.

Какое решение принять сейчас?

Практический чек‑лист (15 минут)

  1. Сколько запросов планируете в месяц? Запишите цифру.
  2. Сколько GPU‑чипов потребуется для этой нагрузки? Проверьте минимальные требования модели в её документации.
  3. Сравните стоимость аренды/покупки GPU + электроэнергии + минимум один администратор с текущим тарифом облачного API.
  4. Оцените риски поставки оборудования и ограничения санкций для вашего региона.
  5. Примите решение:
    * Если self‑hosting стоит более 2‑3 раз дороже — выбирайте API.
    * Если планируете более 100 млн токенов в месяц — рассмотрите гибридный подход (частичный self‑hosting + API‑дополнение).

Проведя эти простые шаги, вы получите чёткое представление о реальных расходах и сможете обосновать выбор перед руководством.

Источники

Что почитать дальше