Перейти к содержанию
вторник, 11 августа 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Сколько на самом деле стоит создать собственную OpenAI: от 5,6 млн до 34 млрд долларов

Источник: Все публикации в потоке Разработка
A lone engineer stands before a massive glowing AI server rack in a dark data center.
Generated by Sourceful Riverflow (RouterAI)

Популярная цифра в 5,6 млн долларов, которую приводят как стоимость обучения DeepSeek-V3, на деле покрывает лишь финальный прогон модели. Полная смета на создание лаборатории, способной воспроизвести подобный результат, включает аренду кластера, исследования и зарплаты, что увеличивает бюджет до десятков миллионов долларов. Реальные расходы OpenAI за 2025 год составили 34 млрд долларов, из которых половина ушла на облачные сервисы Microsoft.

Представьте, что вы решили открыть собственную OpenAI — с нуля, без внешних инвесторов и с ограниченным бюджетом. Первое, что приходит в голову, — это знаменитая цифра 5,576 млн долларов, которую китайская компания DeepSeek указала в техническом отчете как стоимость обучения своей модели V3. Однако, как показывает детальный разбор, эта сумма включает только финальный тренировочный прогон на 2,788 млн GPU-часов, но не учитывает предварительные исследования, абляционные эксперименты, очистку данных, зарплаты сотрудников и покупку самих видеокарт. По сути, это стоимость последнего шага, а не всей работы. Уже на этом этапе становится ясно, что реальный бюджет будет значительно выше, и чем глубже погружаешься в детали, тем больше расхождений между красивой теорией и суровой практикой.

Ключевые цифры из финансовой отчетности OpenAI за 2025 год, которую компания не публиковала официально, но которая просочилась в прессу и была подтверждена Financial Times, показывают масштаб проблемы. Общие расходы компании составили 34 млрд долларов, при этом 17,2 млрд из них ушли одному вендору — Microsoft, за облачные вычисления. Еще 10,5 млрд потрачено на исследования и разработки, 6 млрд — на себестоимость предоставления услуг, и около 0,5 млрд — на маркетинг. Чистый убыток в 38,53 млрд долларов, который часто цитируют в заголовках, на самом деле включает разовую неденежную переоценку конвертируемых инструментов на 41,55 млрд, поэтому реальные операционные потери составляют около 20,92 млрд. Из этой структуры видно, что ни одна статья расходов не связана напрямую с «созданием модели» — все затраты распределены между исследованиями, инфраструктурой и операционной деятельностью.

Технические детали обучения моделей еще больше запутывают картину. В отчете DeepSeek указано, что стоимость не включает исследования, абляции, неудачные прогоны и подготовку данных, а ставка 2 доллара за GPU-час является гипотетической, так как компания использовала собственный кластер. Аналогичные оговорки делают и другие лаборатории: Ai2, например, сообщает о 56 сутках обучения на 1024 картах H100, но не раскрывает расходы на отработку рецепта. Hugging Face в плейбуке по SmolLM3 указывает, что на абляции и калибровку ушло 161 тысяча GPU-часов против 276 тысяч основного рана, то есть более половины сверху. Сбер в статье про GigaChat 3.5 упоминает более 1500 экспериментов, а для GigaChat 3 — отдельный CPU-кластер на 10 000 ядер и 5 ПБ хранилища для подготовки данных. Эти примеры показывают, что реальная стоимость обучения в разы превышает заявленную, и отраслевого коэффициента для пересчета не существует.

Если же говорить о полноценной лаборатории, то аренда кластера становится одной из самых затратных статей. DeepSeek использовала 2048 карт H800 в течение года, хотя финальный прогон занял лишь 15,5% этого времени. Остальное время кластер простаивал или использовался для экспериментов, но платить приходится за все 8760 часов. По оценкам SemiAnalysis, годовой контракт на H100 в марте 2026 года стоит 2,35 доллара за GPU-час, что для 2048 карт дает 42,2 млн долларов в год. Это минимальная оценка, и она уже в семь раз превышает первоначальные 5,6 млн. Для сравнения, Epoch AI оценивает ресурсы, потраченные на обучение Grok 4, в 246 млн H10-часов, что при аналогичных ставках выливается в сотни миллионов долларов. Таким образом, создание даже скромной лаборатории, способной конкурировать с лидерами, требует бюджета в десятки, если не сотни миллионов долларов ежегодно.

Для российского рынка эти цифры имеют особое значение. Местные компании, такие как Сбер, уже сталкиваются с необходимостью оптимизировать расходы на ИИ-разработки, и их опыт показывает, что стоимость экспериментов может превышать стоимость финального прогона в разы. Однако доступ к передовым GPU ограничен санкциями, что заставляет искать альтернативные пути, включая использование отечественных чипов или облачных сервисов. Это увеличивает затраты и удлиняет сроки разработки, но в то же время стимулирует развитие локальных компетенций. Пока западные гиганты тратят миллиарды на инфраструктуру, российские лаборатории вынуждены искать более эффективные подходы, что может привести к появлению уникальных методик обучения с меньшими вычислительными затратами.

Сравнение с альтернативами показывает, что покупка готовых моделей или использование API крупных провайдеров обходится значительно дешевле, чем создание собственной лаборатории. Например, годовая подписка на API OpenAI для среднего бизнеса может стоить несколько сотен тысяч долларов, в то время как собственные разработки требуют миллиардов. Однако для стратегически важных отраслей, таких как оборона или медицина, контроль над технологией может оправдывать затраты. Вопрос лишь в том, готова ли компания нести убытки в течение нескольких лет, прежде чем модель начнет приносить доход. В случае OpenAI убытки составили 20,92 млрд долларов при выручке 34 млрд, что показывает, что даже лидер рынка не может похвастаться прибыльностью.

Перспективы развития ситуации зависят от нескольких факторов. Во-первых, снижение стоимости GPU-часов благодаря новым чипам и конкуренции среди производителей может сделать обучение дешевле. Во-вторых, развитие методов эффективного обучения, таких как дистилляция и малоресурсные подходы, может сократить потребность в огромных кластерах. В-третьих, появление открытых моделей, таких как DeepSeek, снижает барьер входа для новых игроков, но не устраняет необходимость в инфраструктуре. Остается открытым вопрос о том, насколько прозрачными будут отчеты о реальных затратах, поскольку большинство компаний не публикуют полные данные. Ясно одно: цифра в 5,6 млн долларов — это лишь верхушка айсберга, и для создания действительно конкурентоспособной лаборатории потребуются инвестиции, сопоставимые с годовым бюджетом крупной корпорации.

Читайте также