d-Matrix Raptor подключается к NVIDIA NVLink Fusion: что это меняет в AI-серверах
d-Matrix объявила о сотрудничестве с NVIDIA: следующее поколение её inference-ускорителей Raptor будет интегрироваться в стоечную инфраструктуру NVIDIA через NVLink Fusion и платформу MGX. Первые интегрированные системы заявлены на IV квартал 2027 года. Ниже — что подтверждено уже сейчас, какие цифры относятся именно к заявлениям d-Matrix и почему Raptor не стоит воспринимать как универсальную замену GPU.
Ключевые факты
Что произошло
d-Matrix сообщила, что будет использовать NVIDIA NVLink Fusion для подключения следующего поколения Raptor XPUs к инфраструктуре NVIDIA. Речь идёт о многоэтапной продуктовой дорожной карте, а не о уже доступном серийном сервере. NVIDIA отдельно подтвердила интеграцию Raptor в свою AI-инфраструктуру.
Будущая конфигурация рассчитана прежде всего на AI inference — выполнение уже обученных моделей. Целевые сценарии включают чат-ботов, coding assistants, голосовых агентов и другие приложения, где важны задержка выдачи токенов, пропускная способность и энергопотребление.
Почему NVIDIA NVLink Fusion здесь важнее самого названия Raptor
NVLink Fusion позволяет сторонним разработчикам специализированных ускорителей использовать элементы rack-scale инфраструктуры NVIDIA. В случае d-Matrix это означает интеграцию Raptor с NVLink, MGX и сетевыми компонентами платформы NVIDIA, вместо создания полностью собственной стоечной архитектуры.
| Компонент | Роль в интеграции |
|---|---|
| Raptor XPU | Специализированный inference-ускоритель d-Matrix |
| NVLink Fusion | Связь XPU с NVIDIA rack-scale платформой |
| NVLink / MGX | Масштабирование и стоечная архитектура |
| Vera + BlueField-4 + ConnectX-9 | Компоненты заявленной инфраструктуры |
Упрощённая схема. Она показывает архитектурную роль компонентов, а не окончательную конфигурацию серийного сервера.
Что такое Raptor и зачем ему 3D-DRAM
Raptor — второе поколение inference-архитектуры d-Matrix после Corsair. Ключевая идея — разместить вычислительную логику непосредственно над специально разработанной DRAM и сократить путь передачи данных между памятью и вычислителем.
Для inference это особенно важно в decode-фазе: модель генерирует токены последовательно, поэтому ускоритель постоянно читает большие объёмы весов модели и KV-cache. В такой ситуации узким местом может стать не количество вычислительных блоков, а скорость доставки данных из памяти.
d-Matrix заявляет для представленного Raptor более 100 ТБ/с пропускной способности памяти на карту и около 0,37 пДж/бит для передачи данных через вертикальный интерфейс. При этом ёмкость одной карты составляет 32 ГБ. Эти цифры следует воспринимать как характеристики и расчёты производителя для раннего кремния, а не как независимый отраслевой benchmark.
Главный компромисс Raptor: огромная пропускная способность против ёмкости
| Сильная сторона | Ограничение |
|---|---|
|
|
Raptor против обычного GPU: где проходит граница
| Задача | GPU | Raptor / XPU | Практический смысл |
|---|---|---|---|
| Обучение модели | Сильная сторона GPU | Не основная цель | Raptor не позиционируется как замена GPU для training. |
| Prefill | Высокая вычислительная эффективность | Не главный фокус | В гибридной системе GPU может выполнять вычислительно тяжёлую часть. |
| Decode | Универсальный вариант | Основной сценарий | Raptor нацелен на memory-bound часть inference. |
| Низкая задержка | Высокая, но зависит от модели и конфигурации | Приоритет архитектуры | Особенно важно для интерактивных AI-сервисов. |
| Гибридная инфраструктура | Может быть частью системы | Проектируется для совместной работы | Наиболее реалистичный сценарий — не «GPU или Raptor», а специализированный pipeline. |
Две ключевые характеристики Raptor
Эти показатели полезнее абстрактных прогнозов рынка: они сразу показывают сильную сторону архитектуры и её практическое ограничение.
Шкалы намеренно не объединяются в один числовой рейтинг: ТБ/с и ГБ измеряют разные параметры. Визуализация показывает, какие характеристики нужно оценивать одновременно.
Самая полезная цифра — не «100 ТБ/с», а 32 ГБ
В новостях легко сфокусироваться на рекордной bandwidth. Для практического сравнения инфраструктуры важнее одновременно смотреть на пропускную способность, ёмкость памяти, масштабирование, задержку, энергопотребление и стоимость всей системы.
У Raptor заявленная локальная bandwidth очень высокая, но 32 ГБ на карту означают, что крупные модели нельзя рассматривать только в пределах одной карты. Их нужно распределять между ускорителями. Тогда преимущество локальной памяти должно компенсировать дополнительные расходы на обмен данными между картами.
Что известно о производительности — и чего пока не известно
| Показатель | Что заявлено | Статус |
|---|---|---|
| Memory bandwidth | >100 ТБ/с на карту | Ранний кремний / данные d-Matrix |
| Память | 32 ГБ 3D-DRAM на карту | Представленная архитектура |
| Энергия передачи данных | около 0,37 пДж/бит | Измерение, представленное d-Matrix |
| Inference throughput | есть модельные сравнения с HBM-конфигурациями | Не считать универсальным benchmark |
| Цена и TCO | не раскрыты | Пока неизвестно |
| Массовая доступность | ожидается Q4 2027 для интегрированных систем | План / roadmap |
Почему это важно для NVIDIA
Для NVIDIA это продолжение стратегии, в которой компания превращает NVLink и rack-scale инфраструктуру в платформу, способную работать не только с собственными вычислительными ядрами. NVLink Fusion был представлен NVIDIA именно как способ интеграции специализированного compute с её масштабируемой AI-инфраструктурой.
Для рынка это потенциально важнее одного продукта d-Matrix: гиперскейлеры получают больше возможностей для создания гетерогенных AI-стоек, где разные ускорители выполняют разные этапы нагрузки. Такая архитектура снижает зависимость от универсального ускорителя, если специализированный XPU даёт лучший показатель latency, tokens/s/W или TCO для конкретной задачи.
Дорожная карта: что уже произошло и чего ждать
Что это означает для рынка AI-серверов
Сценарий «один универсальный ускоритель для всего» постепенно уступает место гетерогенным вычислительным системам. GPU остаются важными для обучения и вычислительно тяжёлых этапов inference, а специализированные XPU могут брать на себя memory-bound или latency-sensitive части pipeline.
При этом Raptor пока следует рассматривать как перспективную специализированную платформу, а не как доказанную замену NVIDIA GPU. Ключевыми точками проверки в 2027 году станут реальные latency и throughput, масштабирование между картами, цена системы, энергопотребление, доступность памяти и стабильность программного стека.
