Wat is NVLink? Hoe het werkt, bandbreedte en GPU-toepassingen
2026-07-31 283

Moderne multi-GPU-systemen zijn afhankelijk van meer dan alleen ruwe GPU-prestaties. Hoe snel processors gegevens uitwisselen, geheugen benaderen en samenwerken kan een grote invloed hebben op de algehele snelheid. Dit artikel legt NVLink-bandbreedte en generaties uit, vergelijkt NVLink met PCIe en NVSwitch, behandelt GPU-geheugen toegang en NVLink-C2C, en toont aan hoe NVLink wordt gebruikt in AI- en HPC-werkbelastingen. Het helpt je ook te beslissen wanneer NVLink de prestaties kan verbeteren en wanneer PCIe mogelijk al voldoende is.

Catalogus

Figure 1. NVIDIA NVLink High-Speed Interconnect

Figuur 1. NVIDIA NVLink High-Speed Interconnect

Wat is NVLink?

NVLink is NVIDIA's hoog-snelheid interconnect technologie voor het overdragen van gegevens tussen GPU's en andere processors in versnelde computersystemen. Het belangrijkste doel is om communicatie bottlenecks te verminderen wanneer verschillende processors grote hoeveelheden gegevens moeten uitwisselen terwijl ze samenwerken.

In multi-processor systemen kan de prestatie beperkt zijn door hoe snel gegevens tussen apparaten verplaatst worden. NVLink biedt een hoge-bandbreedte, lage-latentie communicatieweg die transfervertragingen vermindert en helpt verbonden processors gegevens efficiënter uit te wisselen.

Hoe werkt NVLink?

Figure 2. NVLink GPU-to-GPU Communication Path

Figuur 2. NVLink GPU-naar-GPU-communicatiepad

NVLink creëert een hoog-snelheid communicatie pad tussen compatibele GPU's en andere processors. Wanneer twee GPU's gegevens moeten uitwisselen, kan peer-to-peer toegang het mogelijk maken dat gegevens rechtstreeks tussen hun geheugens worden verplaatst in plaats van elke overdracht via CPU-geheugen te sturen.

NVLink ondersteunt bidirectionele communicatie, zodat gegevens in beide richtingen kunnen bewegen tussen verbonden processors. Meerdere NVLink-verbindingen kunnen ook samenwerken, waardoor een bredere weg voor gegevensoverdracht tussen processors ontstaat.

NVLink biedt het fysieke pad voor deze communicatie, terwijl software bepaalt hoe en wanneer het pad wordt gebruikt. CUDA, stuurprogramma's, NCCL en de applicatie beheren de overdrachten. Wanneer peer-to-peer toegang wordt ondersteund en ingeschakeld, kan één GPU lezen van, schrijven naar of gegevens kopiëren naar het geheugen van een andere GPU via de beschikbare NVLink-verbinding.

NVLink-generaties en bandbreedte

NVLink-bandbreedte is toegenomen met elke belangrijke NVIDIA GPU-architectuur. De eerste generatie NVLink verscheen met de op Pascal gebaseerde Tesla P100, die vier NVLink-verbindingen ondersteunde en tot 160 GB/s totale bidirectionele bandbreedte per GPU. Volta V100 verhoogde dit naar zes links en 300 GB/s per GPU.

De derde generatie NVLink arriveerde met de Ampere A100. De A100 ondersteunt 12 NVLink-verbindingen en tot 600 GB/s totale bidirectionele bandbreedte per GPU. Hopper H100 verhoogde het aantal links tot 18, waardoor de bandbreedte van NVLink vierde generatie tot 900 GB/s per GPU steeg.

De vijfde generatie NVLink arriveerde met Blackwell, wat de totale bidirectionele bandbreedte tot 1.8 TB/s per GPU verhoogde. De zesde generatie NVLink, geassocieerd met het Rubin-platform, verhoogt het maximum naar 36 links en tot 3.6 TB/s per GPU.

NVLink Generatie
NVIDIA Architectuur
Voorbeeld GPU of Platform
Maximaal Aantal verbindingen per GPU
Maximaal Bidirectionele Bandbreedte per GPU
NVLink 1
Pascal
P100
4
160 GB/s
NVLink 2
Volta
V100
6
300 GB/s
NVLink 3
Ampère
A100
12
600 GB/s
NVLink 4
Hopper
H100
18
900 GB/s
NVLink 5
Blackwell
Blackwell GPU's
18
1.8 TB/s
NVLink 6
Rubin
Rubin platform
36
3.6 TB/s

Per-Link versus Totale NVLink Bandbreedte

Bandbreedte per link en totale bandbreedte per GPU beschrijven verschillende waarden. Een GPU kan meerdere NVLink-verbindingen bevatten, zodat de totale bandbreedte per GPU de bandbreedte combineert die beschikbaar is van alle ondersteunde links.

Bijvoorbeeld, de H100 heeft 18 NVLink 4-verbindingen. Elke link biedt 50 GB/s bidirectionele bandbreedte, wat een maximale totale bandbreedte van 900 GB/s per GPU oplevert. Blackwell gebruikt 18 NVLink 5-verbindingen met 100 GB/s bidirectionele bandbreedte per link, wat tot 1,8 TB/s per GPU produceert.

Deze cijfers vertegenwoordigen de maximale interfacebandbreedte. De werkelijke bandbreedte tussen twee GPU's kan lager zijn, afhankelijk van het aantal actieve links tussen hen, de systeemtopologie en de hardwareconfiguratie. Controleer bij het lezen van NVLink-specificaties altijd of de waarde verwijst naar één link, één GPU of de volledige NVLink-fabric.

NVLink versus PCIe versus NVSwitch

Figuur 3. NVLink versus PCIe versus NVSwitch Vergelijking

NVLink, PCIe en NVSwitch verplaatsen allemaal gegevens binnen GPU-systemen, maar ze vervullen verschillende rollen. PCIe is een interface voor algemeen gebruik die GPU's en andere apparaten met het host-systeem verbindt. NVLink biedt snelle communicatie tussen ondersteunde NVIDIA-processoren, terwijl NVSwitch samenwerkt met NVLink om grotere groepen GPU's via een gedeelde schakelstructuur te verbinden.

Kenmerk
NVLink
PCIe
NVSwitch
Wat het is
Hoge-snelheids processor-interconnectie
Algemene systeeminterface
Schakelstructuur gebruikt met NVLink
Hoofddoel
Snelle communicatie tussen ondersteunde GPU's en processors
Verbind GPU's, SSD's, NIC's en andere apparaten met het systeem
Verbind veel NVLink-enabled GPU's via één fabric
GPU-naar-GPU communicatie
Biedt hoge-bandbreedte peer communicatie
Ondersteunt GPU-naar-GPU overdrachten, maar de prestaties hangen af van de PCIe-topologie
Beheert NVLink-verkeer tussen meerdere GPU's
Gegevenspad
Directe processorlinks of verbindingen via NVSwitch
Verkeer beweegt door PCIe-root complexes en switches
Biedt geschakelde paden tussen NVLink-verbonden GPU's
Latentie
Ontworpen voor lage-latentie processorcommunicatie
Geschikt voor algemene I/O, maar GPU-naar-GPU paden kunnen meer systeeminfrastructuur met zich meebrengen
Voegt schakelen toe terwijl GPU's verbonden blijven via hoge-snelheids NVLink-paden
Topologie
Directe point-to-point links of links naar NVSwitch
CPU-rootcomplexen en PCIe switches
Geschakelde, sterk verbonden GPU fabric
Compatibiliteit
Vereist ondersteunde NVIDIA hardware
Brede ondersteuning van industriestandaarden
Vereist ondersteunde NVIDIA NVLink platforms
Het meest geschikt voor
Communicatie-intensieve multi-GPU systemen
Single-GPU systemen of workloads met beperkte GPU-naar-GPU verkeer
Grote systemen waar veel GPU's frequente communicatie nodig hebben
Hoofdlimiet
Beperkt tot compatibele NVIDIA hardware en platforms
Kan een knelpunt worden in zware inter-GPU workloads
Verhoogt de hardwarekosten en de systeemcomplexiteit

In eenvoudige termen, PCIe verbindt apparaten met het systeem, NVLink biedt hoge-snelheids processor-naar-processor communicatie, en NVSwitch breidt NVLink uit over grotere GPU-configuraties. NVSwitch is geen vervanging voor NVLink omdat het afhankelijk is van NVLink-verbindingen om GPU-verkeer te dragen.

PCIe kan voldoende zijn wanneer GPU-naar-GPU communicatie beperkt is. NVLink wordt nuttiger wanneer GPU's frequent gegevens uitwisselen, terwijl NVSwitch voornamelijk wordt gebruikt wanneer veel NVLink-enabled GPU's schaalbare communicatie binnen hetzelfde systeem nodig hebben.

Combineert NVLink GPU-geheugen?

NVLink combineert niet automatisch het VRAM van meerdere GPU's tot één grotere fysieke geheugenkamer. Twee GPU's met elk 80 GB geheugen hebben nog steeds aparte 80 GB geheugens, in plaats van één GPU met 160 GB lokaal VRAM te worden.

Wanneer de hardware en topologie het ondersteunen, stelt CUDA peer-to-peer geheugen toegang één GPU in staat om toegang te krijgen tot geheugen op een andere GPU. Een GPU kan lezen uit, schrijven naar of gegevens kopiëren naar peer geheugen zonder de gegevens eerst door CPU-geheugen te verplaatsen. NVLink biedt een hoge-bandbreedte pad voor deze overdrachten wanneer de GPUs er via verbonden zijn.

Afstands-GPU-geheugen blijft echter fysiek verbonden met een andere GPU. Software bepaalt nog steeds waar gegevens worden opgeslagen, welke GPU toegang heeft en of de gegevens moeten worden gekopieerd of op afstand worden benaderd. CUDA Unified Memory kan de toegang tot geheugen over apparaten vereenvoudigen, maar het verwijdert de fysieke scheiding tussen GPU-geheugen niet.

Om deze reden is geheugenplaatsing nog steeds belangrijk in multi-GPU systemen. Frequent toegang tot afstands-GPU-geheugen kan de prestaties beïnvloeden, zelfs wanneer NVLink een snellere verbinding biedt.

Hoe NVLink-C2C NVLink uitbreidt naar chip-tot-chipverbindingen

Figure 4. NVLink-C2C Connection Between CPU and GPU

Figuur 4. NVLink-C2C Verbinding Tussen CPU en GPU

NVLink-C2C breidt NVIDIA NVLink uit van processorverbindingen op bordniveau naar korte chip-tot-chipverbindingen binnen een pakket of superchip. Het kan CPU's, GPU's en andere compatibele processor-dies verbinden, zodat ze gegevens kunnen uitwisselen via een strak geïntegreerde verbinding.

Op ondersteunde coherente NVLink-C2C-platforms kunnen verbonden processors ook een consistente kijk op geheugen behouden. Bijvoorbeeld, Grace Hopper gebruikt NVLink-C2C tussen de Grace CPU en Hopper GPU, waardoor beide processors toegang hebben tot geheugen via de verbinding terwijl hun fysieke geheugen gescheiden blijft.

Het belangrijkste verschil is waar elke technologie wordt gebruikt. Standaard NVLink verbindt gewoonlijk aparte GPU's of verbindt GPU's met NVSwitch op bord- of systeemniveau. NVLink-C2C brengt hetzelfde hoge-snelheids interconnect-concept dichter bij de processors zelf, waardoor het geschikt is voor CPU-naar-GPU, CPU-naar-CPU en andere strak geïntegreerde chip-tot-chipverbindingen.

NVLink voor AI en Multi-GPU Werkbelastingen

NVLink is het nuttigst wanneer verschillende GPU's aan dezelfde werkbelasting werken en vaak gegevens uitwisselen. In deze systemen zijn de prestaties niet alleen afhankelijk van GPU rekensnelheid maar ook van hoe snel gegevens bewegen tussen versnellers.

Tijdens AI-training kunnen GPU's gradients, parameters, activaties en tussenresultaten uitwisselen. NVIDIA NCCL beheert veel van deze overdrachten via bewerkingen zoals AllReduce, AllGather, ReduceScatter, Broadcast en point-to-point communicatie.

Tensor parallelisme creëert frequente communicatie omdat delen van dezelfde berekening op verschillende GPU's draaien en gedeeltelijke resultaten moeten worden uitgewisseld voordat de verwerking kan doorgaan. Model parallelisme verplaatst ook gegevens tussen GPU's terwijl verschillende delen van het model worden verwerkt.

Multi-GPU LLM inferentie heeft vergelijkbare vereisten wanneer een groot model over verschillende GPU's is verdeeld. Als één GPU moet wachten op gegevens van een andere, kunnen communicatietrajecten de algehele doorvoer verminderen.

HPC-werkbelastingen zoals wetenschappelijke simulatie, computationele vloeistofdynamica en moleculaire modellering wisselen ook grenskgegevens, gedeeltelijke resultaten en synchronisatie-informatie uit tussen GPU's. Snellere GPU-naar-GPU overdrachten kunnen deze wachttijd verkorten en helpen de werkbelasting efficiënter te laten draaien.

Voor communicatie-zware werkbelastingen kan NVLink de tijd verminderen die GPU's besteden aan het uitwisselen van gegevens en helpen multi-GPU systemen efficiënter te schalen .

Wanneer Heb Je NVLink Nodig?

NVLink is een goede keuze wanneer verschillende GPU's aan dezelfde taak werken en vaak gegevens uitwisselen. Het kan helpen wanneer de communicatie tussen GPU's de werkbelasting vertraagt en het systeem NVLink ondersteunt.

NVLink is een betere keuze wanneer:

• Verschillende GPU's samenwerken aan één werkbelasting

• Grote hoeveelheden gegevens tussen GPU's bewegen

• GPU-communicatie de prestaties beperkt

• De GPU's en het platform NVLink ondersteunen

• De software gebruik kan maken van multi-GPU communicatie

PCIe kan voldoende zijn wanneer:

• Het systeem slechts één GPU gebruikt

• Meerdere GPU's aparte taken behandelen

• GPU-naar-GPU verkeer laag is

• PCIe al voldoet aan de vereiste prestaties

• Lagere kosten en bredere hardware-ondersteuning belangrijker zijn

Kosten en systeemontwerp zijn ook belangrijk. NVLink-capabele systemen vereisen mogelijk ondersteunde GPU's, de juiste systeembovenbouw, extra schakeling en meer vermogen en koeling in grotere configuraties.

Over het algemeen is NVLink het nuttigst wanneer communicatie tussen GPU's een duidelijke prestatiegrens vormt. Als de GPU's zelden gegevens uitwisselen of PCIe al voldoende bandbreedte biedt, kan NVLink kosten en complexiteit toevoegen zonder een duidelijke prestatiewinst.

OVER ONS Klanttevredenheid elke keer weer. Wederzijds vertrouwen en gemeenschappelijke belangen. ARIAT TECH heeft langdurige en stabiele samenwerkingsrelaties opgebouwd met vele fabrikanten en agenten." Klanten behandelen met echte materialen en service als kern beschouwen", alle kwaliteit wordt zonder problemen gecontroleerd en door professionele
functietests gehaald. De meest kosteneffectieve producten en de beste service zijn onze eeuwige belofte.

Veel Gestelde Vragen [FAQ]

1. Kan NVLink de prestaties verbeteren als GPU's niet vaak gegevens delen?

Gewoonlijk niet veel. NVLink biedt de meeste waarde wanneer GPU's gegevens vaak uitwisselen. Als elke GPU voornamelijk afzonderlijk werk verwerkt, is de interconnect mogelijk niet de belangrijkste prestatiebeperking.

2. Waarom beïnvloedt de NVLink-topologie de prestaties van GPU-naar-GPU?

Topologie bepaalt hoe GPU's zijn verbonden en hoeveel NVLink-paden beschikbaar zijn tussen hen. GPU's met meer directe verbindingen kunnen gegevens sneller uitwisselen, terwijl verkeer dat door minder verbindingen of extra switches gaat mogelijk verschillende bandbreedte en latentie heeft.

3. Betekent een hogere NVLink-bandbreedte altijd snellere applicatieprestaties?

Nee. Hogere bandbreedte helpt alleen wanneer gegevensoverdracht tussen GPU's de werklast beperkt. Als rekenkracht, GPU-geheugen, opslag of software-efficiëntie de belangrijkste bottleneck is, kan extra NVLink-bandbreedte weinig effect hebben.

4. Kan CUDA automatisch NVLink gebruiken tussen ondersteunde GPU's?

CUDA kan peer-to-peer-toegang gebruiken wanneer de GPU's, topologie, stuurprogramma's, en softwareconfiguratie het ondersteunen. De applicatie of communicatiesoftware bepaalt echter nog steeds hoe gegevens worden verplaatst, dus alleen het hebben van NVLink-hardware garandeert niet dat elke overdracht het zal gebruiken.

5. Wat is het verschil tussen lokaal en remote GPU-geheugen over NVLink?

Lokaal geheugen is fysiek verbonden met de GPU die het gebruikt, terwijl remote geheugen is verbonden met een andere GPU. NVLink kan een sneller pad bieden naar remote geheugen, maar toegang tot remote verschilt nog steeds van het benaderen van lokaal VRAM, zodat geheugenplaatsing de prestaties kan beïnvloeden.

E-mail: Info@ariat-tech.comHK TEL: +852 30501966Adres: Kamer 2703 27F Ho King Comm Center 2-16,
Fa Yuen St MongKok Kowloon, Hongkong.