【完全図解】NVLinkとは?「1台の巨大GPU」を作る技術とスケールアップ/スケールアウトの違い

AIデータセンター入門
記事内に広告が含まれています。
こんな疑問、ありませんか?
  • 「GB200 NVL72」「NVL72」の「NVL」と「72」が何を意味するのか、実はよく分かっていない
  • NVLinkとInfiniBand、どちらも「GPUをつなぐ」と聞くけれど、何が違うのか説明できない
  • ふつうのPCにもGPUはつながっているのに、なぜAI用だけ専用の配線が必要なのか不思議
  • 「NVIDIAの強さはGPU単体ではない」と聞くけれど、ではどこが強いのかを言葉にできない
答えのカギはNVLink(エヌブイリンク)とNVSwitch(エヌブイスイッチ)です。
この2つがあるおかげで、72個のGPUが「1台の巨大なGPU」のようにふるまえます。
この記事では、PCIeとの差を実際の数字で比べながら、「なぜ72なのか」までを1から整理します。

こんにちは。前回の記事では、ラックとラックをつなぐ「外の道路」(InfiniBand・Ethernet)を扱いました。今回はその内側、ラックの中でGPU同士を結ぶ「中の廊下」の話です。この廊下がとても太いことが、今のAIデータセンターの形を決めています。

あなたが今いる場所:AIインフラ > AIデータセンター入門 > NVLink・NVSwitch(スケールアップ)
▼ AIデータセンターの5つの構成要素
建屋・立地
電力
冷却
計算(GPUサーバー) ←ココ
ネットワーク
▼ DCができるまで(ライフサイクル)
立地・用地確保
電力確保(系統接続)
設計・建設
設備・IT機器搭載 ←ココ
運用・サービス提供
ひとことメモ:NVLinkは「計算」と「ネットワーク」の境目にある技術です。そして後半で見るとおり、冷却(液冷)とラックの電力の事情が「72」という数字を決めています。1つの技術が、DCの3つの要素にまたがっているわけです。
先に結論:この記事の答え

① NVLinkは、NVIDIA(NVDA)独自のGPU同士の専用配線です。Blackwell世代ではGPU1基あたり1.8TB/s(双方向)で、一般的な接続規格PCIe 5.0(x16)の約14倍の太さがあります。

② NVSwitchは、NVLinkを束ねる「交差点」の役割を持つチップです。GB200/GB300 NVL72では18個のNVSwitchが72基のGPUを総当たりでつなぎ、互いのメモリ(HBM)を自分のメモリのように読み書きできるようにします。

③ スケールアップは「1つのまとまりを大きくする」こと、スケールアウトは「まとまりの数を増やす」ことです。ラック内のNVLinkと、ラック外のInfiniBand/Ethernetとでは、GPU1基あたりの帯域に約9倍の差があります。

④ 「72」は偶然の数字ではありません。銅線が届く距離、1ラックに引ける電力(約120kW級)、液冷で冷やせる限界という3つの物理的な制約がちょうど釣り合う点が、NVL72という単位になりました。

PCIeとNVLinkの違いを「実際の数字」で比べる

ふつうのPCやサーバーでは、GPUはPCIe(ピーシーアイ・エクスプレス)という汎用の差し込み口でつながっています。グラフィックボードを挿すあのスロットです。まずは、その太さとNVLinkを並べてみましょう。

128GB/s
PCIe 5.0 x16(双方向)
出典:PCI-SIG規格値
1.8TB/s
NVLink 5(Blackwell)GPU1基あたり
出典:NVIDIA公表値
約14倍
NVLink 5 ÷ PCIe 5.0 x16
1,800 ÷ 128 ≒ 14
接続方式 GPU1基あたり帯域(双方向) PCIe 5.0比 主な搭載GPU
PCIe 5.0 x16128GB/s1倍一般サーバー
PCIe 6.0 x16256GB/s2倍次世代サーバー
NVLink 4900GB/s約7倍H100/H200
NVLink 51.8TB/s約14倍B200/GB200/GB300
NVLink 63.6TB/s約28倍Rubin(Vera Rubin NVL72)
※帯域は送信・受信の合計(双方向)で比較しています。PCIeは規格上の理論値、NVLinkはNVIDIA公表値です。
用語ミニ解説
帯域(バンド幅):1秒間に運べるデータの量。「道路の車線数」のようなものです。
GB/s・TB/s:1秒あたりのギガバイト・テラバイト。1TB/sは、2時間の映画(約5GB)を1秒で約200本送れる速さです。
PCIe:CPUとGPU・SSDなどをつなぐ汎用の接続規格。どのメーカーの部品でも使えるのが強みです。
たとえ話:職員室を通る連絡 vs 教室同士の渡り廊下
PCIeでGPU同士が話すのは、隣のクラスに用事があるたびに職員室(CPU側)を経由して連絡するようなものです。廊下も細いので、ほかのクラスの連絡と重なるとすぐ混みます。
NVLinkは、教室と教室を直接つなぐ、幅の広い専用の渡り廊下です。職員室を通らずに、大量の荷物をまとめて運べます。

NVLinkはどう太くなってきたか(GPU1基あたり・双方向)

NVLink 1
2016年・P100
160GB/s
NVLink 2
2017年・V100
300GB/s
NVLink 3
2020年・A100
600GB/s
NVLink 4
2022年・H100
900GB/s
NVLink 5
2024年〜・Blackwell
1.8TB/s
NVLink 6
2026年〜・Rubin
3.6TB/s
※NVIDIA公表値にもとづく目安。年は対応GPUの発表・出荷開始時期の目安です。

10年で20倍以上太くなりました。ただし本当の変化は、太さよりも「何台を1つにつなげるか」のほうにあります。そこで主役になるのが、次に紹介するNVSwitchです。

NVSwitchとは?72基のGPUを「総当たり」でつなぐ交差点

NVLinkは「線」です。GPUが増えると、全員を線で直接つなぐのは現実的ではありません。72基を全部つなぐと、72×71÷2=2,556本もの組み合わせになります。そこでNVIDIAは、線を中継する専用のスイッチチップ(NVSwitch)を用意しました。

GB200 NVL72ラックの中身(模式図)
コンピュートトレイ × 18台
GPU
GPU
GPU
GPU
CPU
CPU
1トレイ=GPU 4基+Grace CPU 2基
合計:GPU 72基・CPU 36基
⇄
銅線の
背骨
NVLinkスイッチトレイ × 9台
NVSwitch
NVSwitch
1トレイ=NVSwitchチップ 2個
合計:NVSwitch 18個
つなぎ方のルール:各GPUは18本のNVLinkを持ち、18個のNVSwitchそれぞれに1本ずつつながっています。そのため、どのGPUからどのGPUへも「GPU → NVSwitch → GPU」の1回の中継で届きます。
背面には5,000本を超える銅ケーブルの「背骨(NVLinkスパイン)」があり、ラック全体で合計130TB/sの通信ができます(GB200世代・NVIDIA公表値)。
用語ミニ解説
トレイ:ラックに引き出しのように差し込む薄い箱。コンピュートトレイには計算用のGPU・CPUが、スイッチトレイには交差点となるNVSwitchが入っています。
NVLinkドメイン:NVLinkで直接つながったGPUのまとまりのこと。H100世代の標準的なサーバー(HGX)では8基、NVL72では72基です。

72基のGPUを「1つのメモリ空間」に見せるとはどういうことか

NVLinkのすごさは、太さだけではありません。NVLinkドメインの中では、GPUが隣のGPUのメモリ(HBM)に、自分のメモリと同じ感覚で「読む・書く」の命令を直接出せます。ネットワーク越しに「送ってください」と頼んで待つのではなく、手を伸ばして取るイメージです。

ネットワーク越し(スケールアウト)
「GPU②さん、そのデータを送ってください」→ NICが荷造り → ケーブル → 相手のNICが荷ほどき → 受け取り完了。
手紙のやりとりに近く、1回ごとに手続きがかかります。
NVLink越し(スケールアップ)
「GPU②のメモリの◯番地を読む」と命令するだけ。NVSwitchが瞬時に中継します。
同じ机の上の書類を取る感覚で、手続きがほとんどいりません。
288GB
GB300のGPU1基あたりHBM3E容量
出典:NVIDIA公表値
約20TB
NVL72全体で「共有できる」HBM
288GB × 72基 ≒ 20.7TB
たとえ話:72人が囲む1つの大テーブル
スケールアウトは、72人がそれぞれ別の部屋で作業し、必要な資料を内線電話で頼んで届けてもらう職場です。
NVL72は、72人が1つの大きなテーブルを囲んでいる状態です。どの資料も手を伸ばせば届くので、テーブル全体が「1人の超人の机」のように働きます。巨大なAIモデルを1つのGPUに入り切らないまま動かせるのは、この大テーブルがあるからです。

GPUの隣にあるメモリ(HBM)そのものの仕組みは、HBMとは?GPUの隣にある「AI最重要メモリ」で詳しく解説しています。

スケールアップとスケールアウトの違い

ここで、前回のInfiniBand記事と今回のNVLinkを1枚の表にまとめます。「ラックの中か、外か」で役割がはっきり分かれています。

比較項目 スケールアップ スケールアウト
ひとことで1つのまとまりを大きくするまとまりの数を増やす
範囲ラックの中(NVL72なら72基)ラックとラックの間(数千〜数十万基)
代表技術NVLink+NVSwitchInfiniBand・Ethernet(RoCE)
GPU1基あたり帯域1.8TB/s(双方向)800Gb/s NIC = 100GB/s(片方向)≒ 200GB/s(双方向)
帯域の差1,800 ÷ 200 = 約9倍(Blackwell世代の目安)
メモリの扱い互いのHBMを直接読み書き(1つのメモリ空間のように)RDMAで「送る・受け取る」
配線主に銅線(数メートル以内)主に光ファイバー(数十m〜km)
広げられる規模物理的な制約で上限あり建物と電力があればほぼ無制限
※Gb/s(ギガビット)とGB/s(ギガバイト)は8倍違います(1バイト=8ビット)。800Gb/s ÷ 8 = 100GB/sです。数値は構成・世代により異なる目安です。
たとえ話:ビルを高くするか、ビルを増やすか
スケールアップは、1つの会社のフロアを広げることです。全員が同じフロアにいるので相談は一瞬ですが、フロアの広さには建物の限界があります。
スケールアウトは、支社を増やすことです。いくらでも増やせますが、支社同士のやりとりには時間がかかります。

分岐点:「どの通信を、どちらの道に流すか」

AIの学習では、巨大なモデルを複数の分け方で同時に分割します。ポイントは、分け方によって通信の「頻度」と「待てる時間」が大きく違うことです。そこで、頻度の高い通信は太いNVLinkの中に閉じ込め、頻度の低い通信だけを外に出します。

テンソル並列(1つの層を分割)
1つの行列計算を複数のGPUで分担します。層ごとに何度も結果を合わせる必要があり、少しの遅れも許されません。
NVLinkの中へ
エキスパート並列(MoEモデル)
「専門家」ごとに担当GPUを分け、入力ごとに全員が全員へデータを送り合います(All-to-All)。推論でも通信が多くなります。
NVLinkの中へ
パイプライン並列(層ごとに分担)
工場のライン作業のように、層のまとまりを順番に受け渡します。受け渡しは比較的少なめです。
構成次第
データ並列(同じモデルを複製)
データを分けて学習し、1ステップに1回All-Reduceで結果をまとめます。量は多いものの、頻度は低めです。
ラックの外へ
ここが分岐点:NVLinkドメインが大きいほど、「頻繁で待てない通信」を中に閉じ込められる範囲が広がります。8基なら8基分しか閉じ込められませんが、72基なら9倍の規模まで広げられます。これが、NVIDIAがドメインを大きくし続ける理由です。
外に出たデータ並列のAll-Reduceで、なぜ「ばらつき」が致命的になるのかは、InfiniBandとEthernetの違いで詳しく解説しています。
MoE(Mixture of Experts):モデルの中に多数の「専門家」を用意し、入力に応じて一部だけを働かせる設計です。計算を減らせる代わりに、GPU同士の通信が増えます。最近の大規模モデルで広く使われています。

なぜ「NVL72」という単位が生まれたのか

「大きいほど良い」なら、なぜ1,000基や1万基をNVLinkでつながないのでしょうか。答えは、3つの物理的な壁がちょうど「1ラック・72基」あたりで重なるからです。

壁①:銅線が届く距離
超高速信号を銅線で送れるのは、せいぜい1〜2m程度です。それ以上離れると光ファイバーが必要になります。つまり「銅でつなげる範囲=ほぼ1ラック」です。
壁②:光にすると電力が増える
光でつなぐには、電気と光を変換する光トランシーバーが大量に必要です。NVIDIAは、NVL72の背骨を光にすると約20kW余分に電力がかかると説明しています(2024年GTC基調講演)。そこで銅で済ませました。
壁③:電力と熱の上限
GPUを1ラックに詰めるほど、電力と熱が集中します。NVL72は1ラック約120kW級で、液冷が前提です。これは従来DCのラック(数kW〜10kW台)の10倍以上にあたります。
銅が届く範囲 = 約1ラック
光を避けたい(電力+20kWを回避)
1ラックで扱える電力・熱 = 約120kW級(液冷)
= ちょうど釣り合う点が「GPU 72基」
ひとことメモ:120kWは、一般家庭の平均的な使用電力(1世帯あたり約0.4kW、年間約3,500kWhから換算)で割ると約300世帯分です。冷蔵庫ほどの大きさの箱1つが、小さな町内会まるごとの電気を使っていることになります。ラックの物理的な収容の話はGPUラックとは?、液冷の要件はNVIDIAのBlackwellと液冷で解説しています。

NVLinkでつながるGPU数はどう増えてきたか

H100世代
8基
1サーバー(HGX)
空冷が中心
GB200 / GB300
72基
1ラック(NVL72)
液冷が前提 ←現在地
Vera Rubin
72基
NVLink 6で帯域2倍
合計260TB/s
Rubin Ultra(計画)
576ダイ級
新ラック「Kyber」
数百kW級
※NVIDIA公表値・ロードマップにもとづく目安。Rubin Ultraは2027年予定の計画値で、変更される可能性があります。
「72」の数え方に注意:Rubin世代では当初「NVL144」という名前が発表されましたが、のちにGPUのパッケージ数で数える「Vera Rubin NVL72」に呼び方がそろえられました。1パッケージに2つのGPUダイ(チップ本体)が入っているため、ダイで数えると144になります。名前の数字が何を数えているかは、ニュースを読むときに必ず確認しましょう。

従来DC vs AI DC:「サーバー単位」から「ラック単位」へ

比較項目 従来DC AI DC(NVL72時代) 何が変わった
買う単位サーバー1台ずつラック丸ごと1台「ラックが1台の計算機」
ラックの役割サーバーを置く棚配線・電源・冷却が一体の製品棚から「機械」へ
GPU同士の結合PCIe・ネットワーク経由NVLinkで72基が直結約14倍の太さ
重さ数百kg約1.4トン級(報道値)床の耐荷重も設計対象に
故障の影響1台止まっても他は動く1部品の不調がラック全体に響く検査・保守がより重要に

ラックの中でも起きている「専用 vs オープン」の構図

前回、ラックの外で「InfiniBand vs Ultra Ethernet」の対立を見ました。実はラックの中(スケールアップ)でもまったく同じ構図が起きています。

NVLink陣営(NVIDIA)

  • 2016年から約10年の実績。NVL72として量産・出荷中
  • 2025年にNVLink Fusionを発表。他社のCPUや専用チップもNVLinkにつなげるよう、一部を外部に開放
  • MediaTek・Marvell・富士通・Qualcommなどが協業を表明
  • 強み:「今すぐ動く完成品」

オープン規格陣営(UALinkほか)

  • 2024年にUALinkコンソーシアムが発足(AMD・Intel・Google・Meta・Microsoft・HPE・Ciscoなどが参加)
  • 2025年4月に仕様1.0を公開。最大1,024基のスケールアップを想定
  • BroadcomはEthernetベースのスケールアップ(SUE)を提案
  • AMDは72基構成のラック「Helios」を2026年に投入予定と発表
たとえ話:専用充電ケーブル vs USB-C
NVLinkは、1社の製品同士なら最高の性能が出る専用コネクタです。UALinkは、どのメーカーの機器でも挿せるUSB-Cのような共通規格を目指しています。NVLink Fusionは、専用コネクタ側が「一部のメーカーには挿し口を貸します」と歩み寄った動きです。
ひとことメモ:オープン規格側はまだ「仕様と計画」が中心で、NVL72のような大規模な量産実績はこれからです。一方で、ハイパースケーラーが自社開発する専用チップ(TPU・Trainiumなど)は、それぞれ独自のスケールアップ網を持っています。発表ベースの計画と、出荷・稼働の実績は分けて見る必要があります。

投資家向け:「1台の巨大GPU」を支えるお金の流れ

NVL72はラックが丸ごと1つの製品なので、GPU以外の部品(スイッチチップ、銅ケーブル、液冷、組み立て)にもお金が流れます。4層で整理しましょう。

①チップ(GPU・NVSwitch)

  • NVIDIA(NVDA):GPU・NVSwitch・ラック設計を主導
  • TSMC(TSM/台湾2330):製造と先端パッケージ(CoWoS)
  • イビデン(4062):チップを載せるパッケージ基板

②ラック内の配線(銅の背骨)

  • Amphenol(APH):NVL72の銅ケーブル・コネクタの主要供給元(報道ベース)
  • Astera Labs(ALAB):信号をつなぐチップ。NVLink Fusion・UALinkの両方に参加

③ラックの組立・冷却・電源

  • 鴻海(Foxconn)(台湾2317)/Quanta(台湾2382):ラックの組立
  • Supermicro(SMCI)/Dell(DELL):AIサーバー・ラックの販売
  • Vertiv(VRT)/ニデック(6594):液冷CDU・電源

④使う側・対抗する側

  • Microsoft(MSFT)/Oracle(ORCL)/CoreWeave(CRWV):NVL72の大口導入者
  • AMD(AMD):UALinkを推進し、72基のラックで対抗
  • 富士通(6702):NVLink Fusionで自社CPUとの連携を表明
投資判断の前に:ここでは「構造上、恩恵を受けやすい位置」を示しているだけで、特定銘柄を推奨するものではありません。ラックの組み立ては売上規模が大きくても利益率が低いことが多い点に注意が必要です(→「NVIDIAの取引先」という言葉の罠)。NVIDIAを中心とした全体の構造はNVIDIA AI半導体のサプライチェーン全マップ、NVIDIA本体の強さはNVIDIA本体の徹底分析で解説しています。

あなたにとって、この話は何を意味するか

個人投資家の方へ
NVIDIAの強みは「速いGPU」だけではなく、72基を1つにまとめるNVLink・NVSwitch・ソフトの一式にあります。競合がGPU単体で追いついても、ラック単位の完成度で差が残りやすい構造です。一方で、UALinkなどのオープン規格がいつ量産に届くかは、この優位が続くかを測る物差しになります(→「独占」は続くのか|参入障壁の判定法)。
理工系学生の方へ
「どの計算をどのGPUに分けるか」を考える並列化の設計は、AIエンジニアの中心的な仕事の1つです。NVLinkドメインの大きさは、その設計の前提条件になります。情報系なら分散学習、電気系なら高速信号伝送(SerDes)がそのまま活きる分野です。
電気・設備系の技術者の方へ
NVL72は「銅で72基をつなぐ」ためにGPUを1ラックに詰め込んだ結果、1ラック約120kW・液冷前提・1トン超になりました。つまり、ネットワークの都合が受電容量・冷却設計・床荷重を決めています。IT側の構成を知ることが、設備設計の出発点になる時代です。

よくある誤解を4つ解いておきます

誤解1:「NVLinkはInfiniBandの上位版」
役割が違います。NVLinkはラックの中(スケールアップ)、InfiniBandはラックの外(スケールアウト)を担当します。NVL72も、ラック同士はInfiniBandかEthernetでつなぎます。どちらか一方ではなく、両方を使います。
誤解2:「NVL72は、GPUを72個入れた棚にすぎない」
物理的に72個並べるだけなら昔のラックでもできます。NVL72の本質は、18個のNVSwitchで72基を総当たりにつなぎ、互いのメモリを直接読み書きできるようにした「論理的な結合」にあります。
誤解3:「スケールアップを大きくすれば、スケールアウトはいらなくなる」
最先端の学習には数万〜数十万基のGPUが必要です。NVLinkドメインが数百基に広がっても、その外側をつなぐネットワークは必要です。スケールアップが大きくなると、外に出す通信の「質」が変わるだけです。
誤解4:「NVLinkは学習用で、推論には関係ない」
巨大モデルやMoEモデルの推論では、1つのGPUにモデルが入り切らないため、複数のGPUで分担してリアルタイムに通信します。NVIDIAは、NVL72を推論性能の大幅な向上の柱として打ち出しています(→GB300(Blackwell Ultra)とは)。

まとめ:NVLinkは「ラックを1台の計算機」に変えた

NVLinkはGPU同士の専用配線。Blackwell世代で1.8TB/s、PCIe 5.0の約14倍
NVSwitch 18個が72基を総当たりでつなぎ、互いのHBMを直接読み書きできる「1つのメモリ空間」を作る
スケールアップ(ラック内)とスケールアウト(ラック外)では、GPUあたりの帯域に約9倍の差がある
頻繁で待てない通信(テンソル並列・MoE)は中へ、1ステップ1回の通信(データ並列)は外へ
「72」は、銅の到達距離・光の電力コスト・約120kWの電力と熱が釣り合う点
ラックの中でもNVLink vs UALinkという「専用 vs オープン」の構図がある
もっと深く知りたい方へ:4大ボトルネック別の専門ガイド
AIデータセンターは「計算・電力・冷却・通信」の4つで詰まります。気になる扉から進んでください。

よくある質問(FAQ)

Q1. NVLinkとは何ですか?
NVLinkは、NVIDIAが開発したGPU同士を直接つなぐ専用の高速接続技術です。Blackwell世代ではGPU1基あたり1.8TB/s(双方向)の帯域を持ち、汎用規格のPCIe 5.0 x16の約14倍にあたります。
Q2. NVSwitchとは何ですか?
NVSwitchは、多数のGPUのNVLinkを束ねて中継するスイッチチップです。GB200/GB300 NVL72では18個のNVSwitchが72基のGPUを総当たりでつなぎ、どのGPU同士も1回の中継で通信できるようにしています。
Q3. スケールアップとスケールアウトの違いは?
スケールアップは1つのまとまり(ラック)の中でGPUを太く密につなぐこと、スケールアウトはまとまりの数を増やしてネットワークでつなぐことです。AIデータセンターでは、ラック内をNVLink、ラック間をInfiniBandやEthernetでつなぐのが基本です。
Q4. NVL72の「72」は何の数字ですか?
NVLinkで直接つながるGPU(パッケージ)の数です。銅線が届く距離、光を使った場合の電力増加、1ラックで扱える電力と熱(約120kW級・液冷)という物理的な制約が釣り合う規模として、72基が採用されました。
Q5. NVLinkはPCIeの代わりになるのですか?
完全な代わりではありません。GPU同士の通信はNVLinkが担いますが、SSDやネットワークカード(NIC)などの周辺機器との接続には、今もPCIeが使われています。役割を分担していると考えるのが正確です。
Q6. UALinkとは何ですか?
AMD・Intel・Google・Meta・Microsoftなどが参加するUALinkコンソーシアムが定めた、スケールアップ用のオープン規格です。2025年4月に仕様1.0が公開され、最大1,024基のアクセラレータをつなぐことを想定しています。NVLinkへの対抗軸と位置づけられています。
次に読むべき記事
「ラックの中」を理解したら、次は物理・製品・外側・メモリへ。おすすめ順に並べています。
STEP 1|物理の話
GPUラックとは?「高密度化」でデータセンターが変わる理由
72基を1ラックに収めると何が起きるのかを、物理的な収容の視点から解説します。
記事を読む →
STEP 2|製品の話
NVIDIA GB300(Blackwell Ultra)とは|HBM3E 288GB搭載
NVL72の代表的な製品を、スペックと推論性能の視点から見ていきます。
記事を読む →
STEP 3|ラックの外
InfiniBandとEthernetの違いとは?AIデータセンターのネットワーク
ラック同士をつなぐスケールアウトの世界と、All-Reduceの「ばらつき」問題を解説します。
記事を読む →
STEP 4|メモリ
HBMとは?GPUの隣にある「AI最重要メモリ」
NVLinkが「共有」しているメモリの正体を、構造からやさしく解説します。
記事を読む →

コメント

タイトルとURLをコピーしました