Мини-ПК для ИИ: обзор Minisforum MS-S1 Max на Ryzen AI Max
Локальный запуск LLM - это либо дорогая видеокарта уровня RTX 4090, либо облако с его задержками и ценами за токен. Третий путь существовал теоретически, но на деле упирался в узкие места: интегрированная графика захлёбывалась на моделях крупнее 7B, а памяти у типичного мини-ПК хватало разве что для ChatGPT в браузере. Minisforum MS-S1 Max пытается закрыть этот пробел - и у него есть для этого вполне конкретные аргументы.
Что это вообще такое
В основе - AMD Ryzen AI Max+ 395, 16-ядерный процессор архитектуры Zen 5 с интегрированной графикой Radeon 8060S. Не пытайтесь сравнивать её с дискретными картами по числу шейдеров - смысл здесь в другом. iGPU и CPU работают с единым пулом памяти, а это критично для LLM-инференса: модель не гоняется по шине между хостом и видеокартой, она просто живёт в оперативке.
Памяти можно установить до 128 ГБ LPDDR5X-8000 на 256-битной шине. Пропускная способность - около 256 ГБ/с, что сопоставимо с профессиональными ускорителями среднего класса. Подробнее о том, как тип и архитектура памяти влияют на производительность, читайте в нашем материале про особенности и типы серверной оперативной памяти. Для сравнения: RTX 4090 даёт ~1008 ГБ/с, но стоит в несколько раз дороже и требует корпус ATX. MS-S1 Max помещается в 3,2 литра объёма.
NPU встроен отдельным блоком - это XDNA 2 с производительностью до 50 TOPS. Цифру 126 TOPS, которая часто мелькает в описаниях платформы, не стоит приписывать одному NPU: это суммарный показатель всей связки NPU, CPU и графики. На практике NPU берёт на себя фоновую транскрипцию, предобработку запросов и разгрузку CPU при длинных контекстах, а тяжёлый инференс всё равно ложится на iGPU с его быстрой памятью.
Кластер из четырёх MS-S1 Max тянет DeepSeek-R1 671B в квантовании Q4 - и всё это укладывается в бюджет меньше 1 000 000 ₽.
Производительность: цифры без прикрас
Разработчики предусмотрели три режима работы через BIOS или фирменную утилиту: Performance (TDP до 160 Вт), Balanced (~130 Вт) и Quiet (пониженный TDP, приоритет тишине). Разница между крайними режимами по производительности CPU - около 15-20% по Cinebench R23, по iGPU - до 25% в синтетике.
Для задач локального ИИ режим Performance даёт ощутимый прирост скорости генерации токенов. В LM Studio на модели Llama 3.1 70B Q4_K_M скорость генерации при полном объёме памяти держится в районе 8-12 токенов в секунду - это уже комфортная работа, а не ожидание с секундомером.
В Adobe Premiere и Photoshop ИИ-функции - транскрипция видео, нейросетевое масштабирование RAW, генеративное заполнение - работают локально без отправки в облако. 4K-монтаж идёт без существенных задержек при условии, что на борту NVMe SSD.
Железо и расширяемость
Здесь у MS-S1 Max есть козырь, которого нет у большинства конкурентов в компактном сегменте, - слот PCIe 4.0 x16. Полноценный, не x4 в обёртке x16. Это открывает возможность подключить внешний бокс с дискретной картой или специализированный ускоритель вроде AMD Radeon PRO W7900.
Сетевая часть - два порта 10GbE, Wi-Fi 7 и два USB4 V2 с пропускной способностью 80 Гбит/с каждый. Последнее интересно не только для периферии: через USB4 можно подключить внешнее хранилище или NAS с прямым доступом, минуя узкое горлышко обычного гигабита.
Есть опция монтажа в стойку 2U - не самая частая история для устройств такого класса. Это намёк на то, что производитель видит целевую аудиторию не только среди домашних энтузиастов.
Для Proxmox-кластера с ИИ-нагрузкой настройте закрепление ядер (CPU pinning): NPU и iGPU делят ресурсы с ядрами Zen 5, и изоляция снижает задержки инференса.
Охлаждение и шум
Корпус 3,2 л и TDP 160 Вт - это уравнение с ограниченным числом решений. Система охлаждения справляется, троттлинга в стандартных сценариях нет, температуры CPU под нагрузкой держатся в пределах 85-90 °C. Но цена этого - шум.
В режиме Performance вентилятор раскручивается до ~50 дБ(А). Это уровень, который в тихом офисе или домашнем кабинете уже слышно. Для серверной комнаты или технического помещения - нормально, для рабочего стола рядом с монитором - раздражает. В режиме Quiet шум падает до ~35 дБ(А), но и производительность снижается.
Если MS-S1 Max едет в стойку - проблемы нет. Если планируете поставить его на стол и работать рядом под нагрузкой, учитывайте этот момент заранее.
Сравнение с конкурентами
На рынке компактных решений с Ryzen AI Max сейчас несколько игроков. Вот как они соотносятся:
| Модель | CPU / iGPU | RAM макс. | TDP | Цена, ₽ (июль 2026) |
|---|---|---|---|---|
| MS-S1 Max | Ryzen AI Max+ 395 / Radeon 8060S | 128 ГБ | 160 Вт | ~200 000 и выше |
| Bosgame M5 | Ryzen AI Max+ 395 | 128 ГБ | 140 Вт | ~180 000 |
| MS-A2 | Ryzen 9 9955HX | 96 ГБ | 120 Вт | ~150 000 |
Цены здесь - ориентир на июль 2026 по рознице; на импортную технику они подвижные, перед покупкой проверяйте актуальные.
MS-A2 - младший брат на другом процессоре. Ryzen 9 9955HX - мощный мобильный чип, но без выделенного NPU уровня Ryzen AI Max и с меньшей пропускной способностью памяти. Для задач ИИ-инференса разрыв будет ощутимым.
Bosgame M5 на той же платформе, но TDP ограничен 140 Вт против 160 Вт у MS-S1 Max - и это разница в реальных сценариях. Плюс у Minisforum слот PCIe x16 и опция монтажа в стойку, которых у M5 нет.
Когда мини-ПК не подходит
Честная граница, без которой обзор был бы рекламой.
Нужен инференс на моделях, которые не влезают в 128 ГБ. Единый пул памяти - главное преимущество платформы, но и её потолок. Как только модель перестаёт помещаться, начинается выгрузка на диск, и скорость падает до неприемлемой. Кластеризация помогает, но усложняет всё.
Нужна скорость, а не объём. 256 ГБ/с против 1008 ГБ/с у RTX 4090 - разница в четыре раза. Если модель влезает в видеопамять дискретной карты, карта будет кратно быстрее. Мини-ПК выигрывает там, где модель большая, а карта такого объёма стоит несоразмерно.
Нужно обучение, а не инференс. Тренировка и тонкая настройка моделей упираются в вычислительную мощность и пропускную способность, и здесь компактная платформа проигрывает GPU-серверу принципиально.
Нужна круглосуточная нагрузка в стойке. Мини-ПК рассчитан на периодические задачи. Под постоянный инференс на десятки пользователей берут серверы для ИИ с нормальным охлаждением, резервированием питания и удалённым управлением.
Кому это нужно
MS-S1 Max закрывает конкретную нишу: локальный ИИ-инференс без дискретной видеокарты, с возможностью масштабирования через кластер. Четыре таких устройства в стойке 2U - это 512 ГБ объединённой памяти и возможность запускать модели уровня DeepSeek-R1 671B в формате Q4. Для ИТ-отделов, которым нужен приватный LLM без отправки данных в облако, это реальная альтернатива.
Для домашнего сервера на базе Proxmox - тоже вариант, если задачи включают виртуализацию с ИИ-нагрузкой: прежде чем собирать конфигурацию, стоит сверить её с системными требованиями Proxmox для виртуализации. PCIe x16 даёт пространство для манёвра при апгрейде, а 10GbE и USB4 закрывают сетевые потребности. Если же компактная машина нужна не под ИИ, а под обычные офисные службы, посмотрите подборку мини-серверов для малого офиса.
Главный вопрос - цена. Двести с лишним тысяч рублей за мини-ПК требуют чёткого понимания задач. Если нужен просто быстрый рабочий компьютер - есть варианты дешевле. Если нужен компактный узел для локального ИИ с возможностью кластеризации - других таких предложений на рынке сейчас немного.
Частые вопросы
Потянет ли мини-ПК нейросети?
Модели до 70B в квантовании Q4 - да, на платформе Ryzen AI Max с 128 ГБ памяти. Обычный мини-ПК с 16-32 ГБ и типовой встроенной графикой ограничен моделями примерно до 7-8B, и работать с ними придётся медленно.
Сколько памяти нужно для модели на 70B?
В квантовании Q4 такая модель занимает порядка 40 ГБ, плюс место под контекст. То есть 64 ГБ - рабочий минимум, 128 ГБ дают запас на длинный контекст и параллельные задачи.
Чем мини-ПК отличается от GPU-сервера для ИИ?
Объёмом памяти против её скорости. Мини-ПК даёт много единой памяти при умеренной пропускной способности: крупная модель запустится, но быстро работать не будет. GPU-сервер даёт кратно большую пропускную способность на меньшем объёме видеопамяти и годится для обучения и высоконагруженного инференса.
Можно ли объединить несколько мини-ПК в кластер?
Да, и так запускают модели, которые в одну машину не помещаются: четыре устройства дают 512 ГБ общей памяти. Скорость при этом упирается в сеть, поэтому 10GbE здесь не роскошь.
Нужен ли выделенный NPU для локальных LLM?
Для самой генерации токенов главную работу делает графика с быстрой памятью. NPU полезен на вспомогательных задачах - транскрипции, предобработке, фоновых функциях - и разгружает процессор, но видеоядро он не заменяет.
Шумит ли он под нагрузкой?
В режиме Performance - около 50 дБ(А), это заметно на рабочем столе. В режиме Quiet - около 35 дБ(А) ценой части производительности. В серверной или техническом помещении вопрос не стоит.
Нужен приватный ИИ на своём железе, а мини-ПК не закрывает задачу?
Инженеры ITTELO подберут конфигурацию под ваши модели и нагрузку - от компактного узла до GPU-сервера с нужным объёмом видеопамяти, соберут и протестируют под задачу перед отгрузкой, с гарантией и поддержкой после продажи. На рынке серверов 11+ лет.
Серверы для ИИ и нейросетей · +7 (800) 551-80-12 · info@ittelo.ru


