От Т9 за $100 до миллиардных моделей: реальная стоимость обучения LLM с нуля
Обучение языковой модели с нуля может стоить от ста долларов до миллиарда, но за этими цифрами скрываются разные этапы и возможности. Разбираемся, что именно покупается на каждой ступени и как не перепутать претрейн с дообучением.
В октябре 2025 года Андрей Карпатый представил nanochat — полный пайплайн от токенизатора до веб-чата, который можно запустить за четыре часа на арендованной ноде всего за сто долларов. Почти одновременно DeepSeek в техническом отчёте V3 указал стоимость обучения в 5,576 миллиона долларов, а заголовки о том, что китайцы сделали GPT-4 за шесть миллионов, всколыхнули прессу и биржу. Эти три цифры честны, но они почти ничего не говорят о реальной стоимости обучения LLM, потому что за словами «обучить языковую модель» скрывается лестница в семь порядков — от десятков долларов до миллиарда, и путать эти ступени дорого.
Прежде чем считать деньги, важно развести два понятия, которые часто склеивают. Обучение с нуля (pretraining) — это когда веса инициализируются случайным шумом и модель прогоняют через триллионы токенов текста. Дообучение (fine-tuning, LoRA) — когда берут готовые веса и дообучают на своих данных, что на два-три порядка дешевле. Половина статей «как я обучил GPT дома» на самом деле про дообучение. Если задача звучит как «чтобы модель знала наши документы», почти наверняка нужен файнтюн или RAG, а не обучение с нуля. Вся экономика претрейна выводится из формулы C ≈ 6 · N · D, где N — число параметров, D — число токенов обучения, а множитель шесть складывается из forward и backward проходов. Эту формулу используют Kaplan et al. 2020 и Epoch AI для оценки компьют чужих моделей.
На практике стоимость обучения складывается из двух шагов: делим C на реальную скорость железа, получаем секунды, затем умножаем на цену часа. Реальная скорость — это пиковые TFLOPS карты, умноженные на MFU (model FLOPs utilization). Ориентиры из практики: GPT-3 в 2020 году обучалась с MFU 21,3%, PaLM в 2022 году — 46,2%, MegaScale от ByteDance выжал 55,2% на 12 288 GPU, а на одной ноде без сетевых потерь llm.c держит около 60%. Закладывать 40–50% MFU — безопасная оценка. Например, GPT-2 124M на 10 млрд токенов требует 7,4e18 FLOP, что при 60% MFU на ноде 8×A100 даёт около 83 минут и ~20 долларов. Второй столп экономики — сколько токенов нужно: Chinchilla вывела compute-optimal пропорцию 20 токенов на параметр, но современные модели, как Llama 3 8B, обучены на 15+ трлн токенов — 1875 токенов на параметр, в 90 раз дальше оптимума, и качество продолжает расти.
Важно понимать, что базовая модель после претрейна — это не ассистент, а очень дорогой и начитанный Т9. Она умеет только продолжать текст так, как он статистически продолжался бы в обучающем корпусе. Если написать «Привет», модель может ответить «— сказала Маша и закрыла дверь», потому что в интернет-текстах после реплики в кавычках обычно идёт ремарка из художественной литературы. Андрей Карпатый формулирует это одной строкой: «Base models are not assistants, they just want to complete internet documents». Классическое демо из анонса InstructGPT показывает, что голая GPT-3 на запрос «Объясни шестилетнему ребёнку высадку на Луну» отвечает ещё несколькими похожими заданиями, потому что в вебе списки упражнений встречаются чаще, чем готовый ответ.
Для российского рынка эти цифры имеют особое значение. С одной стороны, появление habrGPT — модели 0.5B, обученной с нуля на статьях Хабра на одной RTX 5090 за ~6 часов, — показывает, что базовые эксперименты доступны даже индивидуальным разработчикам. С другой стороны, запросы «обучите нам свою модель» от компаний почти всегда оказываются про дообучение, а не про претрейн. Многие заказчики не понимают разницы между созданием чат-бота и обучением LLM с нуля, а между ними лежат два-три порядка бюджета. Собственная модель с нуля требует не только денег на аренду кластеров, но и огромных объёмов качественных данных, которые в России часто фрагментированы или недоступны.
Сравнение с альтернативами показывает, что для большинства бизнес-задач дообучение или RAG оказываются эффективнее. Например, fine-tuning на открытых весах Llama или Mistral позволяет адаптировать модель под специфические документы за сотни или тысячи долларов, а не за миллионы. При этом качество может быть сопоставимо с обучением с нуля, если данные не уникальны по структуре. Однако для задач, требующих принципиально нового поведения модели — например, работы с редкими языками или специфическими форматами данных, — претрейн остаётся единственным вариантом. В таких случаях важно закладывать бюджет не только на обучение, но и на сбор и очистку данных, которые могут стоить дороже самого компьют.
Перспективы рынка обучения LLM с нуля в России неоднозначны. С одной стороны, снижение стоимости аренды GPU и появление эффективных архитектур, таких как mixture of experts, делают претрейн более доступным. С другой стороны, фронтир-модели требуют миллиардов долларов и тысяч GPU, что доступно лишь крупнейшим корпорациям. Открытым остаётся вопрос, насколько российские компании готовы инвестировать в собственные модели с нуля, учитывая, что даже дообучение на открытых весах может дать 90% нужного функционала. Пока рынок движется в сторону гибридных решений: базовые модели берутся из открытых источников, а дообучение и RAG адаптируют их под конкретные задачи.