NVIDIA Vera: 88 «олимпийских» Arm-ядер для нового поколения ИИ-агентов
NVIDIA Vera: 88 «олимпийских» Arm-ядер для нового поколения ИИ-агентов
Детальный разбор архитектуры нового флагманского CPU NVIDIA, спроектированного с нуля для работы с непредсказуемыми, ветвящимися нагрузками искусственного интеллекта.
Резюме: больше, чем просто процессор
NVIDIA раскрыла архитектурные детали нового процессора Vera — это не просто преемник Grace, а полноценное переосмысление подхода к вычислениям в эпоху агентного ИИ. В отличие от традиционных серверных CPU, оптимизированных под стабильную пропускную способность, Vera создан для «рваных», нерегулярных и чувствительных к задержкам нагрузок, которые определяют работу ИИ-агентов, систем обучения с подкреплением и сложной аналитики данных.
В основе процессора лежит ядро Olympus — кастомная разработка на архитектуре Arm (ARMv9.2), которая ставит во главу угла количество инструкций за такт (IPC), а не частоту. С 88 такими ядрами на одном монолитном кристалле Vera знаменует фундаментальный сдвиг в представлении NVIDIA о серверных вычислениях.
Ядро Olympus: создано для «хаоса» агентного ИИ
Нагрузки агентного ИИ — когда модели принимают решения, совершают действия и взаимодействуют с окружением — принципиально отличаются от традиционных HPC-задач или пакетного вывода. Их характеризуют частые ошибки предсказания ветвлений, обход графоподобных структур данных и непредсказуемый доступ к памяти.
Ядро Olympus спроектировано специально для ускорения этого специфического «нерегулярного» параллелизма. Его ключевые архитектурные решения включают:
Превосходное предсказание ветвлений. Ядро использует нейронный предсказатель ветвлений, способный оценивать две ветки за такт с высокой точностью. В паре с 10-канальным декодером инструкций и очередью на 48 инструкций это обеспечивает огромную пропускную способность выборки (до 16 инструкций за такт). NVIDIA заявляет, что этот блок предсказания обеспечивает до 2,3 раза больше предсказаний за цикл, чем у конкурентов.
Глубокое внеочередное выполнение. Для поиска скрытого параллелизма в длинных цепочках зависимых инструкций Olympus оснащен большим буфером переупорядочивания (ROB) и обширным файлом физических регистров. Это позволяет глубоко выполнять спекулятивные операции и использовать продвинутое переименование, включая технику «переименования памяти» (аналогичную последним разработкам AMD), которая ускоряет выполнение зависимых операций записи и чтения.
Пространственная многопоточность (SMT). Вместо традиционной SMT, которая может приводить к конкуренции за ресурсы ядра, NVIDIA внедрила фирменную пространственную многопоточность. Она позволяет ядру работать как высокопроизводительное однопоточное ядро (когда соседний поток обрабатывает только управляющие операции) или как два изолированных потока для большей плотности, оптимизируя использование ресурсов без снижения производительности.
Детальный обзор «железа»: спецификации и блоки
Процессор Vera — это тщательно сбалансированная система, где каждое ядро, подсистема кэша и интерконнект работают в унисон.
Структура ядра и исполнительные блоки:
Целочисленные операции: 8 простых ALU, 2 ALU для сложных операций (умножение/деление), еще 2 для CRC и сдвигов.
Векторные операции: 6 блоков SVE2 (128-бит) с поддержкой FP8 (против 4 в Grace), плюс 2 блока для криптоопераций (AES, SHA, SM3/4).
Работа с памятью: 4 канала для операций загрузки/сохранения (2 общих, 2 только для загрузки).
Ветвление: 4 блока, работающие в паре с продвинутым предсказателем.
Важно отметить, что в ядре нет явно выделенных каналов для генерации адресов, а все блоки расположены попарно для эффективной работы пространственной многопоточности.
Подсистема кэша и памяти:
Кэш L1: 64 Кбайт (инструкции) + 96 Кбайт (данные) на ядро.
Кэш L2: 2 Мбайт на ядро.
Кэш L3: 164 Мбайт общего кэша на весь чип.
Внешняя память: 8 каналов LPDDR5X-9600 (через модули SOCAMM2) с общей пропускной способностью 1,2 Тбайт/с.
Интерконнект SCF (Scalable Coherency Fabric):
SCF объединяет ядра, кэш L3, контроллеры памяти и блоки ввода-вывода. Его пропускная способность (bisectional) составляет 3,4 Тбайт/с, что почти втрое быстрее, чем вся подсистема внешней памяти. Интерконнект построен на узлах CSN (обслуживают по 2 ядра), MSN (контроллеры памяти) и BSN (интерфейсы NVLink-C2C и PCIe). Монолитная конструкция кристалла позволяет избежать задержек, характерных для чиплетных решений, обеспечивая более предсказуемый доступ к общим данным внутри процессора.
Сравнение с конкурентами и итоговые показатели
NVIDIA сознательно сделала ставку на «широкое» и эффективное ядро, а не на экстремальные тактовые частоты. В своем бенчмарке компания сравнила одноядерный IPC Vera с 128-ядерным AMD EPYC 9755 (архитектура Zen 5) на четырех агентных рабочих нагрузках.
Ключевые результаты сравнения (Vera vs. AMD Zen 5):
IPC (однопоточный режим): выше в 1,9 раза.
Предсказаний ветвлений за цикл: больше в 2,3 раза.
Операций выборки инструкций за цикл: больше в 2,4 раза.
Задержка общения между ядрами: меньше в 2 раза.
Задержка обращений к памяти при полной загрузке: меньше на 40%.
Пропускная способность памяти на ядро: почти в 4 раза выше.
При этом в статье отмечается, что AMD обещает, что будущие процессоры EPYC Venice превзойдут Vera.
Дополнительные возможности и выводы
Ввод-вывод: 88 линий PCIe 6.4 (с поддержкой CXL 3.1 и бифуркацией до x2), что в двухсокетной системе дает 176 линий.
Безопасность: Поддержка Arm CCA, RME-DA и RME-CDA для создания изолированных, защищенных шифрованием виртуальных машин.
Управление ресурсами: Аппаратный механизм MPAM для выделения частей L3-кэша и пропускной способности памяти под конкретные нагрузки.
Итог: NVIDIA Vera — это не просто очередной ARM-процессор. Это целенаправленно созданный инструмент для эры агентного ИИ, где традиционные x86-процессоры начинают испытывать трудности. Ставка на высокий IPC, интеллектуальное предсказание ветвлений и инновационную многопоточность делает Vera мощным заявлением NVIDIA в борьбе за доминирование в инфраструктуре ИИ следующего поколения.
Комментарии
Загрузка комментариев…