256 гигабайт в секунду на одном x16-линке - столько выдаёт CXL 3.0. Цифра впечатляет, пока не задумаешься: зачем такой канал, если данные всё равно нужно тащить из памяти к процессору, обработать и вернуть обратно? Именно тут архитектура Compute Express Link третьего поколения начинает играть совсем другую роль. А вместе с ней появляются устройства вроде XCENA MX1, где тысячи ядер RISC-V обрабатывают данные прямо у памяти, не перемещая их к CPU.
Разберёмся, что изменилось в CXL 3.0, почему расширение памяти сервера через CXL уже не выглядит как экзотика, и как корейский стартап с ускорителями на RISC-V собирается перевернуть подход к нагрузкам, упирающимся в память.
CXL - открытый стандарт межсоединения, построенный поверх физического уровня PCIe. Первая версия появилась в 2019 году, вторая - в 2020-м. К августу 2022 года консорциум выпустил спецификацию CXL 3.0, и с ней всё стало заметно интереснее.
Скорость передачи данных удвоилась - с 32 GT/s до 64 GT/s. Это базовый rate PCIe 6.0, и CXL 3.0 наследует его без дополнительных задержек относительно CXL 2.0. Для x16-линка это даёт те самые 256 ГБ/с агрегированной сырой пропускной способности.
Но скорость - лишь часть истории. CXL 3.0 перешёл на 256-байтные flit'ы (flit, flow control unit - минимальная порция данных, которой шина оперирует на аппаратном уровне) с сигнализацией PAM-4. Для снижения задержки введён latency-optimized flit variant: контрольная сумма CRC разбивается на 128-байтные части, что убирает необходимость накапливать пакет целиком перед отправкой и экономит 2-5 наносекунд. Звучит немного, но когда речь идёт о когерентном доступе к памяти в кластере - каждая наносекунда на счету.
| Параметр | CXL 2.0 | CXL 3.0 |
|---|---|---|
| Базовая скорость линка | 32 GT/s | 64 GT/s |
| Пропускная способность (x16) | 128 ГБ/с | 256 ГБ/с |
| Формат flit | 68 байт | 256 байт |
| Сигнализация | NRZ | PAM-4 |
| Fabric / многоуровневая коммутация | Нет (древовидная) | Да, до 4096 узлов |
| Разделяемая память (когерентная) | Нет | Да |
| Прямой обмен между устройствами без хоста | Нет | Да |
| Обратная совместимость | CXL 1.0/1.1 | CXL 1.0/1.1/2.0 |
Обратная совместимость сохранена: 256-байтный flit работает и на скоростях 8, 16, 32 GT/s. Так CXL 3.0 заходит в существующую инфраструктуру без полной замены оборудования. Дизайнеры серверных платформ берут CXL 3.0 на пониженных скоростях и задействуют новые возможности протокола даже до того, как вся цепочка компонентов доберётся до PCIe Gen6.
Три протокольных субстандарта - CXL.io (блочный ввод-вывод на базе PCIe), CXL.cache (когерентное кэширование) и CXL.mem (доступ к памяти устройства) - по-прежнему мультиплексируются на одном физическом линке. Но в третьей версии появилась back-invalidation: устройство само сообщает хосту, что данные в его кэше устарели, если изменило свою локальную память. Без этого механизма хост мог работать с устаревшими данными, и для кластерных нагрузок это был серьёзный ограничитель.
CXL 2.0 поддерживал одноуровневые коммутаторы с древовидной топологией. Достаточно для простых конфигураций с объединением памяти в пул, но масштабировать такую схему на крупный кластер - задача с жёсткими ограничениями. Древовидная структура не допускает прямого обмена между устройствами: всё проходит через корень иерархии, и задержка растёт с каждым уровнем.
CXL 3.0 вводит полноценную fabric-архитектуру - сеть коммутаторов вместо дерева. Многоуровневая коммутация, недревовидные топологии (mesh, ring, spine/leaf) и механизм адресации Port Based Routing (PBR), поддерживающий до 4096 узлов. Узлом может быть процессорный хост, CXL-ускоритель, PCIe-устройство или GFAM.
GFAM (Global Fabric Attached Memory) - это память, подключённая не к конкретному серверу, а к самой сети коммутаторов, и доступная сразу многим узлам. К одному такому устройству могут обращаться до 4095 узлов fabric'а. Для тех, кто проектирует инфраструктуру из взаимозаменяемых блоков, это тот элемент, которого не хватало: разделяемая CXL-память, доступная кластеру без программной координации. Пул в десятки терабайт, к которому обращаются все вычислительные узлы как к локальной памяти, а аппаратная когерентность гарантирует, что никто не читает устаревшие данные.
Различие, которое легко пропустить: CXL 3.0 разграничивает объединение памяти в пул (pooling) и разделяемую память (sharing). В CXL 2.0 пул делился на сегменты - один хост, один сегмент, одновременный доступ невозможен. Sharing в CXL 3.0 - это когерентный одновременный доступ нескольких хостов к одной области памяти с аппаратной гарантией актуальности данных. Блокировки и барьеры уходят с уровня программы на уровень железа.
Для задач высокой доступности и кластеризации это означает: общий пул памяти между нодами, где каждая видит актуальное состояние данных без накладных расходов на синхронизацию через сеть. Прямой обмен между устройствами без участия хоста дополняет картину - ускорители на RISC-V, GPU и сетевые карты могут обмениваться данными напрямую через CXL fabric.
Расширение памяти сервера через CXL - уже рабочая история. Samsung, Micron, SK hynix выпускают CXL-модули памяти. XCENA пошла дальше: их MX1 умеет считать сам. Это вычислительная память, computational memory - ещё одна претендентка на место в списке перспективных типов памяти, только доехавшая до реального железа.
Идея: вместо того чтобы перемещать гигабайты данных из CXL-памяти к процессору для обработки, можно выполнить вычисления прямо там, где данные лежат. Обработка рядом с данными (near-data processing) - подход, при котором встроенные ядра RISC-V обрабатывают запросы к векторным базам данных, аналитические операции и задачи, упирающиеся в память, без трафика по шине к процессору.
XCENA - бесфабричный стартап из Южной Кореи, основанный в 2022 году (ранее MetisX). Компания привлекла около 50 млн долларов финансирования и оценена примерно в 167 млн. MX1 - их первый продукт, представленный на FMS 2025 (Future of Memory and Storage).
Что в архитектуре MX1 в вычислительном исполнении (цифры по прототипу MX1P, на котором XCENA показывала платформу; у вышедшего позже MX1 Expand компоновка памяти другая, о ней ниже):
Многоуровневое хранение заслуживает отдельного пояснения. MX1 использует SSD как дополнительный уровень: медленнее DRAM, но ёмкость выходит на петабайтный масштаб. Для нагрузок, где горячие данные помещаются в DRAM, а холодные лежат на SSD с минимальными накладными расходами при подкачке, это разумный компромисс между скоростью и стоимостью за терабайт. Механизм напоминает многоуровневое хранение в классических СХД, но реализован на уровне контроллера памяти, а не операционной системы или гипервизора.
Софтверная экосистема - отдельная тема. XCENA поставляет SDK с многоуровневыми интерфейсами: высокоуровневые запускают существующие AI- и аналитические нагрузки без переписывания кода, низкоуровневые дают контроль над размещением данных и управлением задачами на ядрах RISC-V. Драйверы совместимы с Linux и стандартными средами разработки. С ядром стоит уточнить: базовая поддержка CXL-расширителей появилась в Linux заметно раньше, а версия 6.5 добавила уже функции уровня CXL 3.0 - мониторинг производительности, очистку устройства и обновление прошивки. Это снимает барьер входа: не нужно осваивать новую модель программирования или привязываться к проприетарной экосистеме.
Здесь статью пришлось переписать. В мае 2026 года XCENA готовила два чипа под рабочими именами MX1P и MX1S, и мы их так и описывали. В конце июля 2026-го компания объявила production-линейку, а на выставке FMS 2026 (4-6 августа, Санта-Клара) показала её вживую. Названия и состав изменились.
| Параметр | MX1 Compute | MX1 Expand |
|---|---|---|
| Назначение | Расширение памяти по CXL плюс обработка рядом с данными | Расширение памяти узла, переиспользование имеющейся DRAM |
| Ядра RISC-V | 2 048 | Нет |
| Память | Контроллеры DDR5-8400 | Восемь слотов DRAM |
| На кого рассчитан | AI-инференс, векторные БД, аналитика | Гиперскейлеры, наращивание памяти сервера по цене ниже новых модулей |
Разница между двумя вариантами теперь понятнее, чем в прежней схеме с P и S. MX1 Compute - это вычислительная память в чистом виде: 2 048 ядер RISC-V стоят рядом с DRAM и считают там, где лежат данные, вместо того чтобы гонять их к процессору. Именно на нём держится вся идея near-data processing.
MX1 Expand решает более приземлённую задачу. Восемь слотов DRAM, никаких вычислительных ядер, зато возможность переиспользовать уже имеющиеся модули памяти и нарастить объём узла дешевле, чем закупая новые. На фоне того, что происходило с ценами на память, это выглядит не менее интересно, чем вычислительная часть - подробности в разборе глобального дефицита памяти.
На FMS 2026 XCENA показала два сценария, ради которых всё и затевалось:
Заявлена интеграция с платформами Intel Xeon 6. Прежний MX1P никуда не делся, но его статус уточнился: это прототип, который разворачивают в пилотных проектах, а не продукт с полки.
Совместимость с серверными платформами Intel и AMD следующего поколения подразумевается поддержкой PCIe Gen6 и CXL 3.2 на уровне стандарта. XConn Tech уже показал коммутаторы PCIe Gen6 / CXL 3.0, NVIDIA использует Gen6 в платформах B300. Инфраструктурный пазл складывается: коммутаторы готовы, процессорные платформы на подходе, устройства вроде MX1 выходят в производство.
XCENA получила награду «Most Innovative Memory Technology» на FMS 2025 - второе признание подряд после «Most Innovative Startup» в 2024 году.
Чтобы понять ценность вычислительной CXL-памяти, достаточно посмотреть на нагрузки, где процессор тратит время не на вычисления, а на ожидание данных.
Векторные базы данных - основа поиска по смыслу и RAG-пайплайнов. Поиск ближайших соседей по миллиардному индексу требует десятков гигабайт памяти и генерирует хаотичные паттерны чтения. Процессор нагружен минимально, он просто ждёт, пока данные доберутся из памяти. Ядра RISC-V в MX1 выполняют поиск и фильтрацию прямо рядом с DRAM, не создавая трафика на шине.
Аналитика на больших датасетах - сканирование колоночных данных, агрегации, соединения таблиц. Тот же паттерн: данных много, вычислений на единицу данных мало, а узкое место - перемещение между памятью и процессором.
KV-cache для инференса больших языковых моделей - память GPU ограничена, а кэш растёт линейно с длиной контекста. Расширение памяти по CXL с вычислительным ускорением уносит его в CXL-память, и обращаться туда можно, не гоняя данные через хост каждый раз.
Подготовка данных для ML - операции ETL, генерация эмбеддингов, трансформация таблиц. Фреймворки вроде Apache Spark или Velox создают серьёзное давление на память, и MX1 может снять часть этой нагрузки.
Для сред виртуализации (Proxmox, VMware ESXi) расширение памяти через CXL открывает ещё одну плоскость: плотность виртуальных машин ограничена физической памятью хоста. CXL-расширение добавляет терабайты без замены платформы, а обработка рядом с данными снижает нагрузку на процессор хоста при операциях с памятью виртуальных машин - дедупликации, компрессии, поиске пустых страниц. Это дополнительный уровень со своими вычислительными ресурсами, а обычные модули DIMM он не отменяет. Сколько памяти реально нужно под вашу нагрузку, разбирали в отдельной статье.
По словам CEO XCENA Джина Кима, значительная доля энергопотребления и времени в AI- и аналитических нагрузках уходит не на сами вычисления, а на перемещение данных между памятью, процессором и GPU. Объединение памяти в пул решает проблему ёмкости, но этот трафик не устраняет.
Вычислительная память меняет уравнение совокупной стоимости владения в нескольких точках: меньше трафика по шине - меньше энергии и задержка ниже; аппаратная компрессия растит эффективную ёмкость без добавления модулей; многоуровневое хранение снижает стоимость петабайта, оставляя горячие данные в DRAM; снижается зависимость от процессора, и под ту же нагрузку можно взять серверы с меньшим числом сокетов.
Есть и аспект периферийных вычислений. На границе сети серверы часто ограничены по форм-фактору и энергобюджету. CXL-карта с вычислительной памятью обрабатывает аналитику на месте, не отправляя потоки данных в центральный ЦОД. Для сценариев реального времени - видеоаналитика, агрегация с датчиков, предиктивное обслуживание - это сокращает и задержку, и трафик по каналам связи.
Честный ответ: сегодня - нет, и делать вид, что CXL-карта завтра появится в офисной стойке, было бы странно.
Вычислительная память проектируется под гиперскейлеров и крупные AI-кластеры. Ценник, требования к платформе и потребность в софтверной интеграции ставят её далеко за пределы бюджета компании с парком из пяти серверов. Плюс отдельный вопрос доступности такого железа в России, который для корейского стартапа с прицелом на американских облачных провайдеров вообще не стоит на повестке.
Дойдёт до среднего бизнеса это иначе - не отдельными картами, а внутри готовых серверов, когда Intel и AMD доведут поддержку CXL 3.x до массовых платформ, а вендоры начнут ставить CXL-модули в стандартные конфигурации. Тогда «добавить памяти» перестанет означать «поменять материнскую плату или сервер целиком». Пока же практический интерес для владельца небольшой инфраструктуры один: понимать, куда идёт рынок, и не закладываться на пятилетнюю эксплуатацию платформы, которая CXL не умеет вовсе. К слову, диагностика CXL-памяти на уже доступных платформах AMD - тема отдельного разбора.
CXL 4.0 вышла 18 ноября 2025 года на SC25: пропускная способность удваивается до 128 GT/s, стандарт переходит на физический уровень PCIe 7.0 и добавляет объединение портов для связок в 1,5 ТБ/с. Формат 256-байтного flit из CXL 3.x сохраняется. Intel и AMD готовят серверные платформы с поддержкой CXL 3.x, коммутаторы PCIe Gen6 от XConn Tech выходят на рынок.
XCENA перевела MX1 из стадии сэмплов в production-линейку меньше чем за год: рабочие образцы MX1P появились в октябре 2025-го, а в августе 2026-го на FMS уже показывали пул на 20 ТБ и разделяемый KV-cache. Массовым продуктом это пока не стало, и до реальных бенчмарков на боевых нагрузках судить о нём рано.
Что из этого следует практически. CXL 3.0 как стандарт состоялся, и спорить тут не о чем. Станет ли вычислительная память отдельной категорией или останется нишевым инструментом под конкретные нагрузки - решат бенчмарки и готовность софтверного стека. Для тех, кто планирует закупку серверов на несколько лет вперёд, важен один вывод: поддержка CXL в платформе перестала быть экзотикой и постепенно становится строкой в техническом задании. Что ещё меняется в серверной памяти прямо сейчас, разбирали в статье о переходе серверов на DDR5.
Подбираете сервер под AI-инференс или аналитику с большими объёмами памяти?
Инженеры ITTELO помогут рассчитать конфигурацию под конкретную нагрузку, подскажут, где память реально станет узким местом, а где хватит правильно собранного узла на актуальной платформе. Соберём и протестируем под задачу перед отгрузкой, с гарантией и поддержкой после продажи. На рынке серверов 11+ лет.
сервер для искусственного интеллекта · +7 (800) 551-80-12 · info@ittelo.ru