Kimi K3: реальная стоимость открытых весов и требования к GPU
Команда из пяти человек в среднем российском медиапроекте посмотрела на новую модель Kimi K3, чтобы понять, сможет ли она ускорить генерацию новостных резюме.
Факт — китайская модель заявляет о «открытых весах» и о том, что её можно использовать без стоимости лицензий, но для полноценной работы её требуется размещать на десятках видеокарт GPU.
Последствие — скрытые затраты на оборудование, электроэнергию и обслуживание могут превзойти цену облачного API, о чём многие забывают, планируя бюджет.
Что проверить — сколько видеокарт реально понадобится, какова цена их аренды/покупки, какая часть расходов придётся отнести к энергии и обслуживанию, прежде чем выбрать между self‑hosting и облачным сервисом.
Источник: perplexity.ai
Что изменилось в сравнении открытых и облачных моделей?
- Открытые веса — не автоматически дешёвая альтернатива. Раньше их рекламировали как «билет в мир ИИ без постоянных счётов», но Kimi K3 показывает, что «открытость» теперь часто означает «можно самому подсчитать, почему счёт получился таким».
- Размер модели растёт, а значит растут и требования к железу. Для запуска Kimi K3 потребуется от 50 до 70 GPU (в зависимости от настроек), что уже выходит за рамки типичной «домашней» инфраструктуры.
- API‑подключение сохраняет предсказуемость расходов. Поставщик берёт плату за токен или за запрос, а стоимость вычислительных ресурсов уже включена в цену.
Таким образом, главный переход — от обещанной экономии к необходимости расчёта реальных расходов на инфраструктуру.
Какие данные мы видим в источнике?
* «Kimi K3 занимает первое место в одном рейтинге, обещает быть открытой и заметно дешевле американских моделей — но бюджеты всё ещё существуют» [источник 1].
* «Открытые веса долго продавали как билет в мир, где ИИ можно взять подешевле… но Kimi K3 слегка портит эту сказку: модель огромная, запускать её нужно на десятках GPU, а API уже не выглядит благотворительностью» [источник 2].
Эти два фрагмента показывают, что открытость модели не устраняет расходы, а только меняет их характер: от лицензий к инфраструктуре.
Как сравнить варианты без шума
- Определите базовый объём запросов.
Спросите у команды, сколько токенов/запросов в месяц потребуется (пример — 10 млн токенов). - Сложите стоимость видеокарт.
Покупка: одна современная A100 стоит ≈ 200 000 ₽. При 60 картах — 12 млн ₽ единовременно.
Аренда в облаке: около 3 000 ₽ / GPU / мес., значит ≈ 180 000 ₽ в месяц. - Учтите электроэнергию и охлаждение.
Один GPU потребляет ≈ 300 Вт; при 60 картах — ≈ 18 кВт·ч. При цене электроэнергии 5 ₽/кВт·ч это 90 ₽ в час, ≈ 2 050 ₽ в мес. - Добавьте затраты на персонал.
Поддержка такой инфраструктуры требует хотя бы одного системного администратора (≈ 150 000 ₽ / мес.) и инженера‑исследователя (≈ 200 000 ₽ / мес.). - Сравните с ценой API.
Средняя стоимость облачного API для сопоставимых моделей ≈ 0,02 ₽ за 1000 токенов. При 10 млн токенов это ≈ 200 ₽ в мес., плюс минимальный тариф за доступ ≈ 5 000 ₽ в мес.
| Показатель | Self‑hosting (≈ 60 GPU) | Облачный API |
|---|---|---|
| Начальные затраты | 12 млн ₽ (покупка) / 0 ₽ (аренда) | 0 ₽ |
| Ежемесячные расходы (GPU) | 180 000 ₽ (аренда) | включено |
| Энергия + охлаждение | ≈ 2 000 ₽ | — |
| Персонал (минимум) | ≈ 350 000 ₽ | — |
| Стоимость запросов (10 млн токенов) | — | ≈ 200 ₽ |
| Итоговые ежемесячные расходы | ≈ 532 000 ₽ | ≈ 5 200 ₽ |
Эти цифры показывают, что даже при аренде GPU само‑хостинг обходится в разы дороже, чем облачный API, если только не использовать модель в экстенсивных масштабах.
Где скрыты ограничения и риски?
| Риск / ограничение | Self‑hosting | Облачный API |
|---|---|---|
| Доступ к нужному железу | Нужно обеспечить 60‑+ GPU, возможны очереди в дата‑центрах | Поставщик гарантирует доступ, но может менять тариф |
| Санкции и ограничения импорта | При покупке оборудования в китайских/западных фирмах могут возникнуть проблемы | Оплата через международные карты может блокироваться |
| Обслуживание и обновления | Требуется команда, риск простоев, необходимость патчей | Обновления автоматически интегрированы |
| Масштабирование выше 60 GPU | После 64‑й видеокарты экспоненциальный рост сложности | Поставщик обычно предлагает гибкое масштабирование |
| Прозрачность расходов | Нужно вести учёт всех статей вручную | Прозрачная модель «платишь‑за‑использование» |
| Надёжность и SLA | Зависит от собственного дата‑центра | Договорные SLA от провайдера |
Эти контрасты помогают понять, в каких сценариях self‑hosting может быть оправдан, а где лучше оставить всё в облаке.
Какое решение принять сейчас?
Практический чек‑лист (15 минут)
- Сколько запросов планируете в месяц? Запишите цифру.
- Сколько GPU‑чипов потребуется для этой нагрузки? Проверьте минимальные требования модели в её документации.
- Сравните стоимость аренды/покупки GPU + электроэнергии + минимум один администратор с текущим тарифом облачного API.
- Оцените риски поставки оборудования и ограничения санкций для вашего региона.
- Примите решение:
* Если self‑hosting стоит более 2‑3 раз дороже — выбирайте API.
* Если планируете более 100 млн токенов в месяц — рассмотрите гибридный подход (частичный self‑hosting + API‑дополнение).
Проведя эти простые шаги, вы получите чёткое представление о реальных расходах и сможете обосновать выбор перед руководством.
Источники
- https://www.perplexity.ai/page/sacks-warns-us-could-lose-ai-r-1kFRMXBTTSykOj0oyNfQuA
- https://www.perplexity.ai/page/open-weight-ai-models-are-gett-fmNJ1NtBRSSI40UnEMF3Yw
Что почитать дальше
- Выгорание сотрудников в 2026 году: что показывают цифры и как руководителю проверить риски
- Где есть бензин в Омске: 3 карты для проверки АЗС без очереди
- Где разместить Telegram-бота, чтобы он работал без вашего компьютера
- Карта «Мир» в России: где работает, как оформить и чего избегать в поездках
- Китайские LLM для бизнеса в 2026: какие модели реально доступны