Локальный запуск нейросетей позволяет работать с моделями прямо на своем компьютере, не отправляя данные в облачные сервисы. Это дает больше контроля над конфиденциальностью, позволяет использовать собственные данные и снижает зависимость от внешних API и связанных с ними расходов.
Требования к компьютеру при этом сильно зависят от задачи. Запуск небольшой языковой модели, генерация изображений, работа с видео и дообучение LLM требуют разного объема видеопамяти и системных ресурсов.
При выборе рабочей станции для локальных нейросетей в первую очередь стоит смотреть на видеокарту и объем видеопамяти. Именно видеопамять часто определяет, какая модель целиком поместится на видеокарте, насколько длинный контекст можно использовать и потребуется ли переносить часть данных в оперативную память.
Для каких задач используют локальный ИИ
Под локальным запуском нейросетей могут подразумеваться совершенно разные нагрузки.
Локальные языковые модели
Локальные LLM можно использовать для:
- работы с текстом и документами;
- программирования;
- создания локального ассистента;
- анализа внутренней документации;
- RAG-систем;
- генерации и классификации текста;
- ИИ-агентов и автоматизации.
Для запуска таких моделей популярны Ollama, llama.cpp, LM Studio и другие инструменты.
Требования к железу в первую очередь зависят от количества параметров модели, формата весов, квантования и длины контекста.
Генерация изображений
В Stable Diffusion, FLUX и других диффузионных моделях основная вычислительная нагрузка приходится на видеокарту.
Чем сложнее модель, чем выше разрешение и чем больше компонентов входит в пайплайн, тем больше требуется видеопамяти. Современные модели могут занимать десятки гигабайт, поэтому при нехватке видеопамяти применяют квантование и переносят часть компонентов в оперативную память.
Генерация видео
Генеративное видео обычно требовательнее генерации изображений – и к вычислительной мощности, и к памяти.
Разрешение кадров, продолжительность ролика, сама модель и выбранный пайплайн заметно меняют требования. Поэтому рабочей станции для локальной генерации видео обычно требуется больший запас видеопамяти и ОЗУ, чем системе только для LLM или изображений.
Дообучение моделей
LoRA и QLoRA позволяют адаптировать готовую модель под собственные данные без полного обучения всех ее параметров.
Это заметно снижает требования к памяти по сравнению с полноценным обучением модели. QLoRA, например, использует квантованные веса базовой модели и обучает дополнительные низкоранговые параметры.
Полное обучение крупной нейросети с нуля – уже другой класс задачи. Одной мощной видеокарты здесь часто недостаточно: требуются несколько ускорителей, большой объем оперативной памяти и платформа с достаточным количеством PCIe-линий.
Поэтому перед покупкой компьютера важно определить характер нагрузки:
инференс готовых моделей → генерация контента → дообучение → полноценное обучение.
Почему видеокарта важнее процессора
Большая часть современных задач машинного обучения хорошо распараллеливается и выполняется на видеокарте.
В экосистеме NVIDIA вычисления на видеокарте выполняются с помощью CUDA, а характерные для нейросетей матричные операции ускоряются тензорными ядрами (Tensor Cores). Процессор тоже участвует в работе: загружает и подготавливает данные, выполняет токенизацию, обслуживает приложения и берет на себя операции, которые не выполняются на видеокарте.
Но более мощный процессор не компенсирует нехватку видеопамяти.
Если конкретной модели требуется больше 32 ГБ видеопамяти, переход с Ryzen 7 на Ryzen 9 сам по себе не позволит загрузить ее целиком на видеокарту с 32 ГБ.
Поэтому при ограниченном бюджете обычно сначала выбирают видеокарту с достаточным объемом памяти, а затем процессор и остальную платформу.
Сколько видеопамяти нужно для локальных нейросетей
Видеопамять используется для хранения весов модели, промежуточных данных, KV-кэша и других структур, необходимых во время вычислений.
Для LLM расход видеопамяти зависит от:
- количества параметров;
- точности весов;
- типа квантования;
- длины контекста;
- размера KV-кэша;
- количества одновременно обрабатываемых запросов;
- конкретного движка инференса.
Поэтому нельзя утверждать, что любая модель на 30B, то есть примерно 30 млрд параметров, всегда требует строго определенный объем видеопамяти.
Размер самих весов при этом дает полезную отправную точку. Например, Llama 3.1 8B после квантования Q4_K_M занимает около 4,9 ГБ, 70B – около 43 ГБ, а 405B – порядка 249 ГБ. Во время работы потребуется дополнительная видеопамять сверх размера файла модели.
Зачем нужно квантование
В высокой точности крупные LLM занимают огромный объем памяти.
Квантование уменьшает число бит, используемых для хранения весов. 8-битное представление примерно вдвое сокращает объем памяти под веса по сравнению с 16-битным, а 4-битное позволяет уменьшить его еще сильнее.
Квантование может влиять на качество модели и особенности ее работы, но именно оно позволяет запускать крупные LLM на локальных рабочих станциях с ограниченным объемом видеопамяти.
16, 24, 32, 48 или 96 ГБ видеопамяти – что выбрать
Требуемый объем видеопамяти удобнее оценивать по классу задач, поскольку сами модели, способы квантования и программные инструменты быстро меняются.
16 ГБ – для небольших и средних моделей
16 ГБ позволяют работать со многими квантованными LLM малого и среднего размера и запускать большое количество моделей для генерации изображений.
Но запас быстро сокращается при увеличении числа параметров, длины контекста или сложности пайплайна.
Для новой профессиональной станции, которая покупается прежде всего под локальный ИИ, 16 ГБ стоит считать начальным уровнем.
24 ГБ – серьезный рабочий объем
24 ГБ заметно расширяют диапазон доступных моделей и позволяют реже переносить часть модели в оперативную память.
Этого объема хватает для многих локальных LLM, генерации изображений и экспериментов с дообучением сравнительно небольших моделей.
Но тяжелые модели для генерации изображений и видео способны требовать значительно больше памяти, поэтому 24 ГБ не гарантируют, что любой пайплайн полностью поместится на видеокарте.
32 ГБ – сильный вариант для однокарточной станции
32 ГБ – уже серьезный объем видеопамяти для системы с одной видеокартой.
Такой запас позволяет:
- работать с более крупными квантованными LLM;
- использовать более длинный контекст;
- запускать сложные пайплайны генерации изображений;
- экспериментировать с локальной генерацией видео;
- заниматься LoRA и QLoRA в зависимости от размера модели.
GeForce RTX 5090 оснащена 32 ГБ GDDR7 и подходит для широкого диапазона локальных задач машинного обучения.
При этом крупная 70B-модель в Q4 уже может не помещаться целиком в 32 ГБ. Например, у Llama 3.1 70B только квантованные веса Q4_K_M занимают около 43 ГБ. В таком случае придется сильнее квантовать модель, переносить часть данных в оперативную память или переходить на видеокарту с большим объемом памяти.
48 ГБ – для крупных LLM
48 ГБ заметно расширяют возможности локального инференса.
NVIDIA RTX PRO 5000 Blackwell выпускается в том числе с 48 ГБ GDDR7 ECC. Такой объем позволяет запускать модели, которым уже тесно в 32 ГБ, и реже переносить их части в системную память.
Для условной 70B-модели в Q4 48 ГБ находятся около практической границы: сами веса могут поместиться, но дополнительно нужен запас для KV-кэша, контекста и служебных данных.
96 ГБ – профессиональный класс
RTX PRO 6000 Blackwell Workstation Edition имеет 96 ГБ GDDR7 ECC.
96 ГБ позволяют гораздо свободнее работать с:
- крупными LLM;
- длинным контекстом;
- несколькими одновременно загруженными моделями;
- тяжелыми пайплайнами генерации изображений и видео;
- дообучением;
- профессиональными ИИ-проектами.
Но и такой объем имеет предел. Например, Llama 3.1 405B в Q4_K_M занимает около 249 ГБ только весами. Для моделей этого класса уже потребуется распределять нагрузку между несколькими видеокартами, переносить часть данных в оперативную память или использовать более агрессивное квантование.
Можно ли использовать оперативную память вместо видеопамяти
Да. Многие современные инструменты умеют переносить часть модели или отдельные слои в системную память.
Это позволяет запустить модель, которая целиком не помещается в видеопамять.
Но оперативная память не является полноценной заменой видеопамяти. Данные приходится передавать между ОЗУ и видеокартой по PCIe, а это заметно медленнее работы непосредственно с памятью видеокарты.
Особенно заметным падение скорости может быть при активном переносе частей модели в оперативную память.
Поэтому полезно различать два сценария:
модель запускается
и
модель работает с приемлемой скоростью.
Большой объем ОЗУ расширяет возможности станции, но если рабочие задачи постоянно требуют 48–96 ГБ видеопамяти, лучше изначально выбирать видеокарту соответствующего класса.
Сколько оперативной памяти нужно
ОЗУ используется операционной системой, приложениями, подготовкой данных, загрузкой моделей и хранением их частей, которые не помещаются в видеопамять.
32 ГБ
Этого достаточно для сравнительно легких экспериментов с локальными LLM и генерацией изображений.
Для профессиональной рабочей станции запас уже небольшой.
64 ГБ
Хорошая отправная точка для станции с мощной видеокартой.
64 ГБ позволяют одновременно держать инструменты для работы с ИИ, среду разработки, браузер, базы данных и другие рабочие программы, а также оставляют некоторый запас для переноса части модели из видеопамяти.
128 ГБ
Разумный объем для станции с RTX 5090 или RTX PRO, если планируется работать с крупными моделями, большими наборами данных и несколькими приложениями одновременно.
128 ГБ особенно полезны, когда часть модели периодически переносится из видеопамяти в системную.
192–256 ГБ и больше
Такие объемы нужны уже для тяжелых профессиональных сценариев:
- крупных датасетов;
- переноса значительной части больших моделей в ОЗУ;
- нескольких ИИ-сервисов одновременно;
- виртуальных машин;
- научных вычислений;
- систем с несколькими видеокартами;
- подготовки больших объемов данных.
Платформы Threadripper PRO поддерживают ECC RDIMM и значительно большие объемы памяти, чем обычные настольные системы.
Какой процессор выбрать
При локальном инференсе на одной мощной видеокарте процессор обычно не является главным ограничением.
Ryzen 9 9950X, Core Ultra 9 или сопоставимый процессор дают большой запас для:
- подготовки данных;
- компиляции;
- многозадачности;
- переноса части вычислений и данных в системную память;
- нескольких одновременно работающих сервисов;
- программирования и другого профессионального ПО.
Но покупать Threadripper PRO только ради увеличения скорости генерации токенов на одной RTX 5090 обычно нет смысла.
Когда нужен Threadripper PRO
Профессиональная платформа становится оправданной, когда нужны:
- сотни гигабайт оперативной памяти;
- ECC RDIMM;
- несколько видеокарт;
- большое количество PCIe-линий;
- несколько NVMe-накопителей и других PCIe-устройств;
- тяжелая параллельная нагрузка на процессор.
Threadripper PRO особенно полезен как основа для масштабируемой рабочей станции, а не просто как более дорогая альтернатива Ryzen 9.
GeForce RTX или профессиональная RTX PRO
Обе линейки поддерживают CUDA и подходят для локальных задач машинного обучения, но отличаются объемом видеопамяти, поддержкой ECC и рядом профессиональных возможностей.
GeForce RTX 5090
RTX 5090 имеет 32 ГБ GDDR7 и высокую вычислительную производительность.
Она хорошо подходит для локальных LLM, генерации изображений и видео и других задач с CUDA, если используемым моделям достаточно 32 ГБ видеопамяти.
Для многих индивидуальных разработчиков и специалистов этого достаточно, чтобы получить мощную локальную систему для работы с ИИ без перехода на RTX PRO.
RTX PRO 5000 Blackwell 48 ГБ
Главное преимущество RTX PRO 5000 с 48 ГБ GDDR7 ECC перед RTX 5090 в задачах локального ИИ – больший объем видеопамяти: 48 ГБ вместо 32 ГБ.
Дополнительные 16 ГБ позволяют целиком размещать в видеопамяти часть моделей, для которых на RTX 5090 пришлось бы использовать более сильное квантование или переносить часть данных в ОЗУ.
Если основная задача – работа с крупными LLM, дополнительный объем памяти может быть важнее пиковой вычислительной производительности GeForce.
RTX PRO 6000 Blackwell
RTX PRO 6000 оснащена 96 ГБ GDDR7 ECC.
Этого объема уже достаточно для многих крупных локальных моделей, длинного контекста, тяжелого инференса и дообучения.
Если рабочие нагрузки регулярно выходят за пределы 32–48 ГБ, 96 ГБ позволяют значительно реже прибегать к агрессивному квантованию и переносу части модели в системную память.
На практике выбор между RTX 5090 и RTX PRO 6000 во многом определяется тем, хватает ли рабочим моделям 32 ГБ видеопамяти.
NVIDIA или AMD для локальных нейросетей
Современные инструменты для работы с нейросетями умеют работать не только с NVIDIA.
Ollama, например, поддерживает GeForce RTX и профессиональные RTX через CUDA, а также ряд AMD Radeon и Radeon PRO через ROCm. ComfyUI тоже работает с несколькими аппаратными платформами.
Но совместимость зависит от конкретного набора программ и библиотек.
CUDA широко поддерживается в инструментах для машинного обучения и генеративного ИИ, поэтому при покупке станции под разные модели и фреймворки NVIDIA обычно обеспечивает наиболее предсказуемую совместимость.
Если рабочие программы и библиотеки поддерживают ROCm, AMD тоже может быть подходящим вариантом. Поддержку нужного программного стека лучше проверить до покупки оборудования.
Сколько места нужно на SSD
Модели быстро занимают место на накопителе.
Даже одна квантованная 70B-модель может весить десятки гигабайт, а в реальной работе обычно хранятся:
- несколько моделей;
- разные варианты квантования;
- чекпойнты;
- LoRA;
- диффузионные модели;
- VAE;
- ControlNet;
- датасеты;
- результаты генерации.
Поэтому для специализированной рабочей станции 1 ТБ уже стоит считать минимальным объемом.
Для большинства профессиональных систем разумно начинать с 2 ТБ, а при активной работе с моделями и данными рассматривать 4 ТБ и больше.
Скорость накопителя влияет прежде всего на загрузку моделей и работу с данными. После загрузки модели в видеопамять более быстрый NVMe сам по себе не увеличивает скорость генерации токенов.
Нужны ли две или четыре видеокарты
Несколько видеокарт позволяют распределять крупные модели и вычисления между несколькими ускорителями.
Но две видеокарты по 32 ГБ не превращаются автоматически в одну видеокарту с 64 ГБ общей памяти.
Программа должна поддерживать распределение модели между устройствами. В зависимости от фреймворка это может быть разделение модели между видеокартами (sharding), тензорный параллелизм, конвейерный параллелизм или другой способ распределения вычислений.
Эффективность такого подхода зависит от модели, программного обеспечения и скорости обмена данными между видеокартами.
В многокарточной станции также особенно важны:
- количество PCIe-линий;
- число линий, реально доступных каждому слоту;
- пропускная способность PCIe;
- мощность блока питания;
- охлаждение;
- корпус;
- возможности материнской платы.
Для двух и тем более четырех мощных ускорителей обычная настольная платформа часто становится ограничением. Здесь и раскрываются преимущества Threadripper PRO и WRX90.
Как подобрать ПК под разные задачи
Для разных сценариев можно ориентироваться на следующие конфигурации:
| Задача | Видеопамять | ОЗУ |
| Небольшие локальные LLM, генерация изображений | 16–24 ГБ | 32–64 ГБ |
| Средние LLM, тяжелые пайплайны генерации изображений и видео | 24–32 ГБ | 64–128 ГБ |
| Крупные квантованные LLM, LoRA/QLoRA | 48 ГБ | 64–128 ГБ |
| Большие LLM, длинный контекст, тяжелое дообучение | 96 ГБ | 128–256 ГБ |
| Модели, не помещающиеся на одной видеокарте, профессиональное обучение | несколько видеокарт | 256–768 ГБ и больше |
Это не системные требования конкретных моделей. Одна и та же видеокарта может запускать очень разные LLM в зависимости от квантования, длины контекста и выбранного движка. Для систем с несколькими видеокартами дополнительно важна платформа с достаточным количеством PCIe-линий – например, Threadripper PRO / WRX90.
Таблица показывает, когда переход на следующий класс рабочей станции начинает давать практическую пользу.
Примеры рабочих станций для локального ИИ
Ниже – пять конфигураций MAN-MADE, которые показывают, как меняется рабочая станция по мере роста требований: от RTX 5090 с 32 ГБ видеопамяти до профессиональной многокарточной системы на Threadripper PRO.
Force v.6 – RTX 5090 и 32 ГБ видеопамяти
Конфигурация:
- GeForce RTX 5090 32 ГБ;
- Ryzen 9 9950X;
- 96 ГБ DDR5-6000;
- SSD 2 ТБ + 4 ТБ.
Force v.6 сочетает RTX 5090 с 32 ГБ видеопамяти и 96 ГБ ОЗУ. Такой объем подходит для широкого диапазона локальных LLM, генерации изображений и видео и других вычислительных задач, пока используемые модели помещаются в память видеокарты.
96 ГБ оперативной памяти оставляют хороший запас для работы с данными и частичного переноса модели в системную память, а два SSD суммарным объемом 6 ТБ позволяют хранить большую библиотеку моделей, датасетов и результатов генерации.
Pro v.8 – 48 ГБ видеопамяти для более крупных моделей
Конфигурация:
- NVIDIA RTX PRO 5000 Blackwell 48 ГБ;
- Ryzen 9 9950X;
- 96 ГБ DDR5-6000;
- SSD 4 ТБ Samsung 9100 PRO.
У Pro v.8 объем видеопамяти увеличивается до 48 ГБ при тех же 96 ГБ ОЗУ. По сравнению с RTX 5090 это позволяет реже прибегать к сильному квантованию и переносу части модели в системную память.
Часть крупных LLM уже можно полностью разместить в памяти видеокарты, тогда как 32 ГБ для тех же моделей может быть недостаточно. Поэтому эта конфигурация особенно интересна для задач, где одним из главных ограничений становится объем памяти под веса модели, KV-кэш и контекст.
Elite v.2 – рабочая станция с 96 ГБ видеопамяти
Конфигурация:
- NVIDIA RTX PRO 6000 Blackwell 96 ГБ;
- Ryzen 9 9950X;
- 96 ГБ DDR5;
- SSD 1 ТБ + 2 ТБ.
В Elite v.2 установлена RTX PRO 6000 с 96 ГБ GDDR7 ECC.
Такого объема достаточно для многих крупных локальных моделей, длинного контекста и более тяжелого дообучения без постоянного переноса данных в системную память. 96 ГБ видеопамяти также удобны для сложных пайплайнов генерации изображений и видео, где на видеокарте одновременно должны находиться несколько компонентов.
Но и 96 ГБ не позволяют разместить на одной видеокарте самые крупные модели. Для моделей на сотни миллиардов параметров по-прежнему может потребоваться распределение нагрузки между несколькими видеокартами или перенос части данных в ОЗУ.
Infinity v.2 – переход на Threadripper PRO
Конфигурация:
- NVIDIA RTX PRO 6000 Blackwell 96 ГБ;
- Ryzen Threadripper PRO 9955WX;
- 128 ГБ DDR5 ECC RDIMM;
- SSD 2 ТБ + 2 ТБ.
Infinity v.2 использует ту же RTX PRO 6000 с 96 ГБ видеопамяти, что и Elite v.2, но уже построена на платформе Threadripper PRO с ECC RDIMM.
Переход на такой класс системы нужен не ради увеличения видеопамяти. Его преимущества появляются, когда требуется больше возможностей для PCIe-устройств, большой объем памяти с ECC или запас для дальнейшего масштабирования рабочей станции.
Для локального инференса на одной RTX PRO 6000 возможностей Elite v.2 во многих случаях достаточно. Infinity v.2 имеет смысл, когда важна уже не только сама видеокарта, но и возможности платформы вокруг нее.
Quantum v.6 – две RTX PRO 6000 для тяжелых задач
Конфигурация:
- 2 × NVIDIA RTX PRO 6000;
- Ryzen Threadripper PRO 9995WX;
- 768 ГБ DDR5 ECC RDIMM;
- SSD 2 ТБ + 4 ТБ.
Quantum v.6 – это уже совершенно другой класс рабочей станции: две RTX PRO 6000, Threadripper PRO и 768 ГБ оперативной памяти.
Две видеокарты позволяют распределять крупные модели и вычисления между несколькими ускорителями, если это поддерживает используемый фреймворк. Threadripper PRO обеспечивает необходимый запас PCIe-линий, а 768 ГБ ОЗУ рассчитаны уже на крупные датасеты, перенос частей моделей в системную память, подготовку данных, несколько ИИ-сервисов и другие профессиональные нагрузки.
Для обычного локального инференса небольшой или средней модели такая конфигурация избыточна. Quantum v.6 нужна там, где рабочая нагрузка действительно выходит за возможности одной RTX PRO 6000 и умеет эффективно использовать несколько ускорителей.
За что не стоит переплачивать
За дорогой процессор при недостатке видеопамяти
При инференсе на видеокарте переход на Threadripper PRO не позволит загрузить модель, если она не помещается в видеопамять.
Сначала нужно подобрать видеокарту под рабочие модели, а затем выбирать процессор и платформу.
За сотни гигабайт ОЗУ без реальной задачи
Если все используемые модели уверенно помещаются в видеопамять, увеличение ОЗУ до 256 или 768 ГБ само по себе почти не повлияет на скорость инференса.
Такие объемы нужны для крупных датасетов, переноса частей модели в системную память, нескольких сервисов, виртуализации и систем с несколькими видеокартами.
За RTX PRO, если достаточно 32 ГБ видеопамяти
GeForce RTX 5090 остается мощным вариантом для локальных моделей, если 32 ГБ видеопамяти хватает для рабочих задач.
Переход на RTX PRO имеет смысл прежде всего тогда, когда нужны 48 или 96 ГБ видеопамяти и память с ECC.
Если модели помещаются в 32 ГБ и используемые библиотеки нормально работают с GeForce, профессиональная видеокарта не является обязательным условием.
Что проверить перед покупкой
Перед выбором рабочей станции стоит ответить на несколько вопросов:
- Какие именно модели планируется запускать?
- Какой объем занимают их веса в нужном формате и квантовании?
- Какая длина контекста потребуется?
- Нужен только инференс или также дообучение?
- Нужно ли одновременно держать несколько моделей?
- Какие технологии поддерживают используемые программы и библиотеки – CUDA, ROCm или другие?
- Понадобится ли переносить часть модели в оперативную память?
- Сколько места потребуется под модели, датасеты и результаты работы?
- Планируется ли добавлять вторую видеокарту?
Типичная ошибка – сначала выбрать дорогую рабочую станцию, а затем обнаружить, что нужная модель не помещается в видеопамять или используемый фреймворк плохо поддерживает выбранное оборудование.
Итог
При выборе ПК для локальных нейросетей главным ограничением часто становится объем видеопамяти.
16–24 ГБ подходят для сравнительно легких моделей и генеративных задач. 32 ГБ дают хороший запас для локальных LLM и работы с изображениями или видео. 48 ГБ позволяют перейти к более крупным моделям, а 96 ГБ относятся уже к профессиональному классу для тяжелого инференса и дообучения.
Оперативная память особенно важна при переносе части модели из видеопамяти, работе с большими данными и одновременном запуске нескольких сервисов. Для мощной рабочей станции 64–128 ГБ дают хороший запас, а сотни гигабайт памяти с ECC нужны уже для тяжелых профессиональных сценариев и систем с несколькими видеокартами.
Процессор остается важной частью системы, но при инференсе с ускорением на видеокарте по приоритету обычно уступает ей.
Поэтому рабочую станцию лучше подбирать под конкретные модели и задачи: сначала определить необходимый объем видеопамяти, затем ОЗУ, выбрать процессор и платформу с нужным запасом для масштабирования, а после этого – объем и конфигурацию накопителей.