Тестирование DeepSeek, Qwen и GLM на ПК с RTX 5090: что реально запустить дома
Автор блога на Хабре решил проверить, какие современные LLM можно запустить на продвинутом пользовательском ПК с RTX 5090 и 192 ГБ ОЗУ. В условиях выхода сразу нескольких крупных моделей, включая DeepSeek V4 Flash и Qwen 3.8, он провел сравнительное тестирование производительности и практической применимости.
Энтузиаст, известный под ником «ваш покорный слуга», обновил свой компьютер до конфигурации с видеокартой RTX 5090 и 96 ГБ оперативной памяти, рассчитывая, что такой системы хватит для запуска любых локальных нейросетей. Однако выход DeepSeek V4 Flash в апреле показал, что даже этих ресурсов недостаточно: для работы с моделями уровня Qwen 3.6 требовался квант Q2 или предельный режим Q3XSS. В итоге автор решил расширить ОЗУ до 192 ГБ, докупив второй комплект планок, и после настройки напряжений система стабильно заработала на частоте 6000 МГц в режиме 1:1. Это позволило перейти к тестированию целого ряда новых LLM, которые вышли в конце лета.
Конец лета 2026 года оказался богатым на релизы: DeepSeek V4 Flash (0731) — MoE-модель на 284 миллиарда параметров с 13 миллиардами активных, предназначенная для ИИ-агентов; Qwen 3.8 27B — плотная модель, которая помещается на одну видеокарту; GLM 5.3 Flash — мультимодальная MoE-модель на 320 миллиардов параметров с 18 миллиардами активных; Qwen 3.8 Flash Next — архитектурное превью линейки Qwen 4 с примерно 125 миллиардами обычных параметров, 51 миллиардом n-граммных эмбеддингов и 6 миллиардами активных на токен. Кроме того, появились менее крупные модели, такие как Ornith 1.5 35B-A3B и 397B. Автор поставил перед собой задачу выяснить, какие из этих моделей реально запускать дома с приемлемой скоростью, большим контекстом и без разрушительного квантования.
Для тестирования использовался локальный LLM-сервер на базе llama.cpp, запускаемый через cmd-скрипт, с обращением через клиент Jan Desktop. Каждой модели выдавались три однотипные задачи: написание подробного технического объяснения механизма спекулятивного декодирования, создание SVG-изображения с ослом на велосипеде и медведем в лесу, а также генерация полноценной браузерной игры в стиле Battle City. Задачи были подобраны так, чтобы проверить как текстовые способности, так и умение работать с кодом и структурированными форматами. Все тесты выполнялись в режиме one-shot, без дополнительной настройки параметров, что имитирует реальное использование.
Результаты показали, что даже с 192 ГБ ОЗУ запуск большинства MoE-моделей в полном контексте 256К токенов требует компромиссов. Например, DeepSeek V4 Flash в кванте Q4_K_XL занимает около 150 ГБ, что оставляет мало места для кэша и контекста, поэтому приходилось ограничивать контекст до 128К или использовать более агрессивное квантование. Qwen 3.8 27B показал себя отлично: модель полностью помещается в VRAM видеокарты RTX 5090 (32 ГБ), обеспечивая высокую скорость генерации даже с большим контекстом. GLM 5.3 Flash, несмотря на свои 320 миллиардов параметров, оказался требователен к памяти, но при использовании кванта Q4_K_XL и активации режима авторазмещения тензоров (--fit) смог работать с контекстом до 128К, хотя и с пониженной скоростью.
Наибольший интерес вызвала модель Qwen 3.8 Flash Next, которая использует гибридную архитектуру с рекуррентными и attention-слоями, а также n-граммные эмбеддинги. Её суммарный объём составляет около 180 миллиардов параметров, но благодаря тому, что активны лишь 6 миллиардов на токен, скорость обработки оказалась достаточно высокой даже при запуске на CPU с частичной выгрузкой в VRAM. Однако автор отметил, что для комфортной работы с такими моделями необходимо тщательно настраивать параметры запуска, включая размер контекста, количество потоков и режим кэширования. В противном случае можно столкнуться с резким падением производительности или ошибками нехватки памяти.
Для российского рынка локальных LLM эта статья имеет практическое значение, поскольку многие разработчики и энтузиасты в стране ограничены в доступе к облачным сервисам и вынуждены полагаться на собственное железо. Автор подчёркивает, что даже достаточно мощный ПК с RTX 5090 не является «серебряной пулей»: для запуска передовых моделей требуются либо значительные объёмы ОЗУ (от 192 ГБ), либо использование оптимизированных квантованных версий, либо переход на дистиллированные модели меньшего размера. В комментариях к публикации пользователи обсуждают альтернативы, такие как использование Mac Studio с объединённой памятью или кластеров из нескольких видеокарт, но сходятся во мнении, что на данный момент оптимальным выбором для дома остаются плотные модели вроде Qwen 3.8 27B.
В перспективе автор планирует продолжить тестирование с более тщательной настройкой параметров, включая использование спекулятивного декодирования и различных схем квантования. Он также отмечает, что многие модели, включая GLM 5.3 Flash, поддерживают мультимодальность, что открывает новые возможности для локального использования. Однако остаются открытые вопросы о совместимости с различными фреймворками и о том, как поведут себя эти модели при длительной работе с постоянно растущим контекстом. Пока же можно констатировать, что индустрия движется в сторону увеличения числа параметров, и для рядовых пользователей это означает необходимость либо обновлять железо, либо искать компромиссы в виде квантования и дистилляции. Статья вызвала живой отклик у аудитории Хабра, что подтверждает высокий интерес к локальному запуску больших языковых моделей.