Эксперты связывают рост расходов с увеличением требований новых LLM к памяти и вычислительным мощностям
Развертывание крупных языковых моделей в России заметно подорожало за последний год. По данным MWS Cloud, средняя стоимость минимальной конфигурации на ускорителях Nvidia для запуска одной LLM выросла с 13,7 млн рублей в 2025 году до 38,8 млн рублей в 2026 году — в 2,8 раза.
В исследовании сравнили семь моделей 2026 года с шестью решениями, представленными годом ранее. Расчеты учитывали минимальное число GPU, необходимое для работы с запросом максимального заявленного объема, а также серверы и сетевое оборудование.
Самой дорогой для развертывания в 2025 году оказалась Kimi K2 — около 35 млн рублей за восемь H200. В 2026 году лидером стала Kimi K3: восемь ускорителей B300 обойдутся примерно в 80 млн рублей. Qwen3.5, DeepSeek-V4-Pro и GLM-5.2 требуют по восемь H200, стоимость такой конфигурации оценивается в 55 млн рублей.
Рост расходов связан с увеличением размеров и возможностей новых моделей. Для обработки больших объемов данных им требуется больше видеопамяти и производительные ускорители, которые также дорожают на фоне высокого мирового спроса.
MWS Cloud также изучила применение китайских Huawei Ascend 910B. Среднее количество таких ускорителей для поддерживаемых моделей выросло с 10,7 до 13,6 за год. При этом точной официальной цены на них нет, а оценочная стоимость составляет 50–67% от сопоставимых решений Nvidia.
