Гонка ИИ-ускорителей: почему России стоит смотреть за пределы GPU
Современные ИИ-системы упираются не в пиковые FLOPS, а в пропускную способность памяти и интерконнектов. Для России это открывает альтернативные ниши — Edge AI, промышленная автоматизация и робототехника, где можно конкурировать за счёт специализации, а не догоняющих инвестиций в универсальные GPU.
Вопрос о создании российского аналога GPU NVIDIA часто ставится слишком прямолинейно, будто речь идёт об одном устройстве. На деле это несколько независимых задач: проектирование вычислительного кристалла, освоение современного техпроцесса, интеграция памяти HBM, разработка серверной платформы и создание программной экосистемы. Каждая из них требует собственных компетенций, инфраструктуры и инвестиций, а успех в одной не гарантирует готового продукта. Поэтому обсуждение места России в гонке ИИ-ускорителей имеет смысл начинать с понимания, из чего складывается реальная производительность современной системы.
Ключевая проблема заключается в растущем дисбалансе между скоростью вычислений и скоростью доставки данных. С 2012 по 2022 год производительность 64-битных вычислений в GPU NVIDIA выросла примерно в 80 раз, тогда как пропускная способность памяти увеличилась лишь в 17 раз. При переходе к форматам FP16, FP8 и FP4 разрыв становится ещё заметнее: арифметические блоки обрабатывают компактные данные быстрее, но память и интерфейсы не ускоряются в той же пропорции. В результате значительная часть времени и энергии тратится не на вычисления как таковые, а на хранение и перемещение данных. Этот дисбаланс усугубляется усложнением моделей: длинный контекст увеличивает размер KV-кэша, архитектуры Mixture of Experts требуют хранения огромного числа весов, а рассуждающие модели генерируют дополнительные последовательности токенов.
Современный ускоритель работает не изолированно, а внутри сложной программно-аппаратной системы, которую можно сравнить с производственной линией. Вычислительные блоки выполняют основные операции, память хранит веса и промежуточные данные, интерфейсы перевозят информацию между узлами, хост-процессор готовит входные данные и распределяет задания, а компилятор переводит модель в последовательность операций, понятных конкретному чипу. Если хотя бы один участок работает медленно, простои возникают по всей цепочке. Именно поэтому сравнение устройств только по FLOPS даёт ограниченное представление: два ускорителя с одинаковой пиковой мощностью могут заметно отличаться по скорости выполнения одной и той же модели из-за различий в объёме локальной памяти, пропускной способности DRAM или HBM, эффективности кэширования и качества компилятора. В аппаратной платформе важен баланс между скоростью вычислений, ёмкостью и пропускной способностью памяти, задержкой доступа, скоростью интерконнекта, энергопотреблением, стоимостью и полнотой программной поддержки. Улучшение одного показателя часто ухудшает другой, поэтому современные ускорители проектируют совместно с программным стеком.
В этом контексте попытки полностью повторить NVIDIA выглядят крайне сложной и капиталоёмкой задачей на ближайшую перспективу. Однако рынок ИИ-вычислений не ограничивается обучением крупнейших языковых моделей. Существуют задачи вывода моделей, периферийных вычислений, промышленной автоматизации и робототехники, где решающими характеристиками становятся не абсолютные FLOPS, а задержка, энергопотребление, предсказуемость времени реакции и интеграция с конкретным оборудованием. В таких системах архитектура RISC-V может использоваться по-разному: как процессор для Edge AI, как управляющее ядро внутри ускорителя, как контроллер перемещения данных или как часть гетерогенной вычислительной платформы. По словам Родиона Ерохина, руководителя направления разработки аппаратного обеспечения компании «Аквариус», тезис о том, что «быстрый чип ждет данные», особенно близок разработчикам собственных RISC-V решений. Это подтверждает, что отрасль осознаёт проблему и ищет обходные пути.
Для российского рынка такой разворот означает смену приоритетов. Вместо гонки за универсальными GPU, требующей доступа к передовым техпроцессам и HBM, ставка может быть сделана на специализированные решения для Edge AI, промышленной автоматизации и робототехники. Здесь важны не рекордные FLOPS, а надёжность, низкое энергопотребление и способность работать в жёстких условиях. RISC-V предоставляет открытую архитектуру, которую можно адаптировать под конкретные задачи без лицензионных отчислений и зависимости от внешних поставщиков. Уже сейчас российские компании, такие как «Аквариус», разрабатывают собственные решения на RISC-V, ориентированные на управление данными и периферийные вычисления. Это не попытка догнать NVIDIA в лоб, а поиск ниши, где можно быть конкурентоспособным за счёт специализации и интеграции с локальными потребностями.
Сравнение с альтернативами показывает, что путь универсальных GPU не является единственным. Китайские компании, например, активно развивают собственные ускорители, но сталкиваются с теми же ограничениями по памяти и техпроцессу. Европейские проекты, такие как Graphcore или Cerebras, предлагают принципиально иные архитектуры, но их рыночная доля остаётся небольшой. Для России более реалистичным выглядит сценарий, при котором создаются заказные решения для конкретных отраслей: беспилотного транспорта, медицинской диагностики, систем видеонаблюдения с ИИ. В этих областях требования к задержке и энергопотреблению часто важнее пиковой производительности, а программная экосистема может быть менее требовательной к совместимости с мировыми стандартами. Кроме того, развитие RISC-V позволяет создавать гетерогенные платформы, где управляющие ядра и ускорители проектируются совместно, что снижает накладные расходы на передачу данных.
Перспективы российского участия в гонке ИИ-ускорителей зависят от нескольких факторов. Во-первых, необходимо развивать не только аппаратную, но и программную часть: компиляторы, библиотеки, инструменты профилирования. Без этого даже удачный чип останется невостребованным. Во-вторых, важно наладить кооперацию между разработчиками чипов, производителями оборудования и конечными заказчиками, чтобы требования к системе формировались с учётом реальных сценариев. В-третьих, открытым остаётся вопрос финансирования: создание современного ускорителя требует миллиардных инвестиций, и без государственной поддержки или крупных частных вложений прорыв маловероятен. Тем не менее, ставка на специализированные решения и открытые архитектуры выглядит более реалистичной, чем попытка догнать лидеров в производстве универсальных GPU. Вопрос лишь в том, хватит ли у отрасли последовательности и времени, чтобы превратить эти ниши в работающий бизнес.