Начало Прес съобщения AMD обяви най-бързия в света HPC ускорител за научни изследвания

AMD обяви най-бързия в света HPC ускорител за научни изследвания

479
1

 

 

Графичните карти AMD Instinct™ MI100 дават силен тласък на високопроизводителните изчислителни среди и системите за изкуствен интелект

 

Първият GPU ускорител с нова AMD CDNA архитектура за exascale ерата

 

Санта Клара, Калифорния, 16 ноември 2020 г. AMD (NASDAQ: AMD) днес анонсира графичния ускорител AMD Instinct™ MI100 – най-бързия в света GPU предназначен за високопроизводителни изчислителни среди (НРС) и първия x86 сървърен GPU, който преминава бариерата от 10 teraflops (FP64) производителност. С подкрепата на нови платформи за ускорени изчисления от Dell, Gigabyte, HPE и Supermicro, MI100 заедно с AMD EPYCTM процесорите и отворената софтуерна платформа ROCm™ 4.0 разкрива нови възможности за научни изследвания в епохата на exascale суперкомпютрите.

Графичният процесор AMD Instinct MI100 е изграден по новата AMD CDNA архитектура. Той предлага до 11,5 TFLOPS върхова производителност в изчисленията с плаваща запетая с двойна точност (FP64) за HPC среди и до 46,1 TFLOPS върхова производителност при изчисления с плаваща запетая с единична точност (FP32) за платформи с изкуствен интелект (ИИ) и машинно самообучение. С новата AMD Matrix Core технология MI100 вдига почти 7-кратно теоретичната производителност при FP16 изчисления (изчисления с половин точност) за ИИ обучителни задачи, в сравнение с предишното поколение ускорители на компанията.

Отворена софтуерна платформа за Exascale ерата

Софтуерът за разработчици ROCm на AMD дава основата за exascale изчислителните среди. Като набор от инструменти с отворен код, съставен от компайлери, приложни интерфейси за програмиране (API) и библиотеки, ROCm се използва от разработчиците на exascale софтуер за създаване на високопроизводителни приложения. ROCm 4.0 е оптимизиран да предложи мащабна производителност за MI100-базираните системи. В ROCm 4.0 е ъпгрейднат компайлера да бъде с отворен код и унифициран за поддръжка на OpenMP® 5.0 и на HIP. PyTorch и Tensorflow платформите, които са оптимизирани с ROCm 4.0, сега могат да постигнат по-висока производителност с MI100. ROCm 4.0 е най-новото предложение за разработчиците на приложения за HPC, машинно обучение и изкуствен интелект, което им позволява да създават високопроизводителен, преносим софтуер.

“Ние получихме ранен достъп до ускорителя MI100 и първоначалните резултати са много окуражаващи. Виждаме значителни повишения на производителността, до 2-3 пъти в сравнение с други GPU,” каза Бронсън Месер, научен директор на водещата изчислителна инсталация в Оук Ридж. “Важно е да разберем какво е въздействието, което софтуерът има върху производителността. Отворената софтуерна платформа ROCm и инструментът за разработчици HIP са с отворен код и работят на голямо разнообразие от платформи, и ние сме големи привърженици на този вид средства откакто създадохме първата хибридна CPU/GPU система.”

Ключовите възможности и характеристики на ускорителя AMD Instinct MI100 включват:

  • Изцяло нова AMD CDNA архитектура AMD CDNA предлага изключителна производителност и енергийна ефективност;
  • Водеща FP64 и FP32 производителност за HPC приложения – предлага 11,5 TFLOPS върхова FP64 и 23,1 TFLOPS върхова FP32 производителност за научните изследователи от цял свят в широка гама от дейности – биология, енергетика, финанси, отбрана и много други.
  • Изцяло нова Matrix Core технология за HPC и AI – Суперпроизводителност за матрични изчисления с единична и смесена точност като FP32, FP16, bFloat16, Int8 и Int4, предназначена за тласне напред сливането между HPC и AI среди.
  • 2-ро поколение AMD Infinity Fabric™ технологияInstinct MI100 предоставя приблизително 2 пъти по-висока peer-to-peer (P2P) върхова I/O пропускателна способност спрямо PCIe® 4.0, с до 340 GB/s обща пропускателна способност на карта с три AMD Infinity Fabric™ връзки. В един сървър графичните карти MI100 могат да бъдат конфигурирани с до два напълно свързани модула с по четири GPU всеки от които осигурява до 552 GB/s P2P I/O пропускателна способност за бързо споделяне на данни.
  • Ултрабърза HBM2 памет – 32GB HBM2 памет работеща на тактова честота 1,2 GHz, като осигурява ултрависока 1,23 TB/s пропускателна способност, за да поддържа работа с големи масиви данни и помага да се елиминират тесните места при прехвърляне на данните към и от паметта.
  • Поддръжка на PCIe® Gen 4.0 – графичната карта е проектирана с поддръжка на най-новата PCIe Gen 4.0 технология за до 64GB/s върхова скорост про обмен на данни от CPU към

 

Наличие на сървърни решения

Ускорителите AMD Instinct MI100 се очакват към края на годината в системи от големите ОЕМ производители и ODM партньори в корпоративните пазари, сред които Dell, Gigabyte, Hewlett Packard Enterprise (HPE), Supermicro.

Спецификации на MI100

Изчисл. единици Поточни процесори FP64 TFLOPS (върх.) FP32 TFLOPS (върх.) FP32 Matrix TFLOPS

(върх.)

FP16/FP16 Matrix
TFLOPS

(върх.)

INT4 | INT8 TOPS

(върх.)

bFloat16 TFLOPs

(върх.)

HBM2
ECC
памет
Пропускателна способност с паметта
120 7680 до 11,5 до 23,1 до 46,1 до 184,6 до 184,6 до 92,3 TFLOPS 32GB до 1.23 TB/s

 

Поддържащи източници

За AMD

В продължение на 50 години AMD тласка напред иновациите във високопроизводителните изчислителни среди, в графиката и визуализационните технологии – градивните блокове за потопяващи игрови и визуализационни платформи и информационни центрове. Стотици милиони потребители, водещи бизнеси от Fortune 500 класацията и научни институции в света разчитат на технологиите на AMD за ежедневно подобряване на начина, по който живеят, работят и играят. Служителите на AMD в цял свят са фокусирани върху изграждането на отлични продукти, които преместват напред границите на нашите възможности. Допълнителна информация какви възможности дава AMD  днес и как вдъхновява бъдещето ще намерите на уебсайта, в блога, Facebook и Twitter страниците на компанията.

 

 

©2020 Advanced Micro Devices, Inc. All rights reserved. AMD, the AMD Arrow logo, EPYC, AMD Instinct, Infinity Fabric, ROCm and combinations thereof are trademarks of Advanced Micro Devices, Inc. The OpenMP name and the OpenMP logos are registered trademarks of the OpenMP Architecture Review Board. PCIe is a registered trademark of PCI-SIG Corporation. Python is a trademark of the Python Software Foundation. PyTorch is a trademark or registered trademark of PyTorch. TensorFlow, the TensorFlow logo and any related marks are trademarks of Google Inc. Other product names used in this publication are for identification purposes only and may be trademarks of their respective companies.

  1. Calculations conducted by AMD Performance Labs as of Sep 18, 2020 for the AMD Instinct™ MI100 (32GB HBM2 PCIe® card) accelerator at 1,502 MHz peak boost engine clock resulted in 11.54 TFLOPS peak double precision (FP64), 46.1 TFLOPS peak single precision matrix (FP32), 23.1 TFLOPS peak single precision (FP32), 184.6 TFLOPS peak half precision (FP16) peak theoretical, floating-point performance. Published results on the NVidia Ampere A100 (40GB) GPU accelerator resulted in 9.7 TFLOPS peak double precision (FP64). 19.5 TFLOPS peak single precision (FP32), 78 TFLOPS peak half precision (FP16) theoretical, floating-point performance. Server manufacturers may vary configuration offerings yielding different results. MI100-03
  2. Calculations performed by AMD Performance Labs as of Sep 3, 2020 on the AMD Instinct™ MI100 (32GB HBM2 PCIe® card) accelerator at 1,502 MHz peak engine clock resulted in 46.1 TFLOPS peak theoretical single precision (FP32 Matrix) Math floating-point performance. The Nvidia Ampere A100 (40GB) GPU accelerator published results are 19.5 TFLOPS peak single precision (FP32) floating-point performance. Nvidia results found at: https://www.nvidia.com/content/dam/en-zz/Solutions/Data-Center/nvidia-ampere-architecture-whitepaper.pdf.   Server manufacturers may vary configuration offerings yielding different results. MI100-01
  3. Calculations performed by AMD Performance Labs as of Sep 18, 2020 for the AMD Instinct™ MI100 accelerator at 1,502 MHz peak boost engine clock resulted in 184.57 TFLOPS peak theoretical half precision (FP16) and 46.14 TFLOPS peak theoretical single precision (FP32 Matrix) floating-point performance. The results calculated for Radeon Instinct™ MI50 GPU at 1,725 MHz peak engine clock resulted in 26.5 TFLOPS peak theoretical half precision (FP16) and 13.25 TFLOPS peak theoretical single precision (FP32 Matrix) floating-point performance. Server manufacturers may vary configuration offerings yielding different results. MI100-04
  4. Calculations as of SEP 18th, 2020. AMD Instinct™ MI100 built on AMD CDNA technology accelerators supporting PCIe® Gen4 providing up to 64 GB/s peak theoretical transport data bandwidth from CPU to GPU per card. AMD Instinct™ MI100 accelerators include three Infinity Fabric™ links providing up to 276 GB/s peak theoretical GPU to GPU or Peer-to-Peer (P2P) transport rate bandwidth performance per GPU card. Combined with PCIe Gen4 support providing an aggregate GPU card I/O peak bandwidth of up to 340 GB/s. MI100s have three links: 92 GB/s * 3 links per GPU = 276 GB/s. Four GPU hives provide up to 552 GB/s peak theoretical P2P performance. Dual 4 GPU hives in a server provide up to 1.1 TB/s total peak theoretical direct P2P performance per server. AMD Infinity Fabric link technology not enabled: Four GPU hives provide up to 256 GB/s peak theoretical P2P performance with PCIe® 4.0. Server manufacturers may vary configuration offerings yielding different results. MI100-07
  5. Calculations by AMD Performance Labs as of Oct 5th, 2020 for the AMD Instinct™ MI100 accelerator designed with AMD CDNA 7nm FinFET process technology at 1,200 MHz peak memory clock resulted in 1.2288 TFLOPS peak theoretical memory bandwidth performance. The results calculated for Radeon Instinct™ MI50 GPU designed with “Vega” 7nm FinFET process technology with 1,000 MHz peak memory clock resulted in 1.024 TFLOPS peak theoretical memory bandwidth performance. CDNA-04
  6. Works with PCIe® Gen 4.0 and Gen 3.0 compliant motherboards. Performance may vary from motherboard to motherboard. Refer to system or motherboard provider for individual product performance and features.
  7. Testing Conducted by AMD performance labs as of October 30th, 2020, on three platforms and software versions typical for the launch dates of the Radeon Instinct MI25 (2018), MI50 (2019) and AMD Instinct MI100 GPU (2020) running the benchmark application Quicksilver. MI100 platform (2020): Gigabyte G482-Z51-00 system comprised of Dual Socket AMD EPYC™ 7702 64-Core Processor, AMD Instinct™ MI100 GPU, ROCm™ 3.10 driver, 512GB DDR4, RHEL 8.2.  MI50 platform (2019): Supermicro® SYS-4029GP-TRT2 system comprised of Dual Socket Intel Xeon® Gold® 6132, Radeon Instinct™ MI50 GPU, ROCm 2.10 driver, 256 GB DDR4, SLES15SP1. MI25 platform (2018): Supermicro SYS-4028GR-TR2 system comprised of Dual Socket Intel Xeon CPU E5-2690, Radeon Instinct™ MI25 GPU, ROCm 2.0.89 driver, 246GB DDR4 system memory, Ubuntu 16.04.5 LTS. MI100-14
  8. Testing Conducted by AMD performance labs as of October 30th, 2020, on three platforms and software versions typical for the launch dates of the Radeon Instinct MI25 (2018), MI50 (2019) and AMD Instinct MI100 GPU (2020) running the benchmark application TensorFlow ResNet 50 FP 16 batch size 128. MI100 platform (2020): Gigabyte G482-Z51-00 system comprised of Dual Socket AMD EPYC™ 7702 64-Core Processor, AMD Instinct™ MI100 GPU, ROCm™ 3.10 driver, 512GB DDR4, RHEL 8.2. MI50 platform (2019): Supermicro® SYS-4029GP-TRT2 system comprised of Dual Socket Intel Xeon® Gold® 6254, Radeon Instinct™ MI50 GPU, ROCm 3.0.6 driver, 338 GB DDR4, Ubuntu® 16.04.6 LTS. MI25 platform (2018): a Supermicro SYS-4028GR-TR2 system comprised of Dual Socket Intel Xeon CPU E5-2690, Radeon Instinct™ MI25 GPU, ROCm 2.0.89 driver, 246GB DDR4 system memory, Ubuntu 16.04.5 LTS. MI100-15

1 коментар

  1. Текстът се застъпва с рекламите горе-вдясно.

    Наистина е най-бързият ускорител. Напълно превъзхожда не само всичко представено от Нвидиа, но дори мечтите на инженерите в зеления отбор! :)

ВАШИЯТ КОМЕНТАР

Моля, въведете коментар!
Моля, въведете името си тук