液体冷却により Nvidia の Blackwell プラットフォームのパフォーマンスと効率が向上
Oct 14, 2024
ご伝言
人工知能 (AI)、特に生成 AI (GenAI) や大規模言語モデル (LLM) などの分野の急速な成長により、コンピューティング能力に対する前例のない需要が高まっています。 AI モデルがより複雑になり、より多くのデータが必要になるにつれて、これらの進歩をサポートするために必要なハードウェアは、特に熱放散に関して重大な課題に直面しています。空冷などの従来の冷却方法は、最先端の AI ハードウェアの電力消費を管理するにはもはや不十分であり、ここで液体冷却ソリューションが活躍します。
液体冷却テクノロジーは、AI データセンターの熱出力を管理する非常に効率的な方法として注目を集めています。これは、Nvidia の Blackwell アーキテクチャのようなプラットフォームでは特に重要です。プラットフォームでは、膨大な計算能力により、パフォーマンスと寿命を確保するために高度な冷却システムが必要になります。
でホットチップ 2024カンファレンスで、Nvidia は革新的なソリューションを紹介しました。温水 チップへの直接液体冷却Blackwell アーキテクチャを採用したテクノロジーにより、増加する電力消費と冷却の課題に対処します。この開発は、AI ハードウェア設計における重要な進歩を意味し、運用コストを削減し、大規模な AI アプリケーションの効率を向上させます。

▲ Hot Chips チュートリアル: 液体冷却によりパフォーマンスと効率が向上
液体冷却技術の台頭
AI チップの電力需要の増大により、液体冷却技術が AI データセンター設計の重要なコンポーネントとして浮上しています。 AI アプリケーションの成長に伴い、データセンターの電力消費量は大幅に増加すると予想されます。 Nvidia の H100 とその新しいプロセッサを含む多くの AI プロセッサブラックウェルのアーキテクチャ、700Wから1200Wの電力を消費します。この膨大なエネルギーの消費は、数千の GPU で構成される AI クラスターが同時に動作するとさらに増大します。
例えば、イーロン・マスクの AI トレーニング クラスターは、100 個の 000 H100 GPU を搭載した世界最大のシステムで、31- メガワットのエネルギー需要を管理するために完全に水冷式です。このような例は、運用コストを削減するだけでなく、AI システムの全体的なパフォーマンスを向上させるためにも、冷却テクノロジーの最適化が重要である理由を示しています。より高性能な AI へのニーズが高まるにつれ、液体冷却は高性能コンピューティング システムを維持する上でますます中心的な役割を果たすことになります。
AI データセンターにおける液体冷却の利点
液体冷却は、CPU や GPU などの重要なコンポーネントから直接熱を逃がす能力により際立っており、従来の空冷と比較して熱放散が向上します。で直接液体冷却 (DLC)、冷却剤がチップと直接接触するため、熱効率が向上し、大型のファンや空調システムの必要性が軽減されます。これにより、冷却のためのエネルギー消費が削減され、データセンターの総運用コストが削減されます。
さらに、浸漬液体冷却では、サーバー全体が誘電性の液体に浸されており、さらに効果的な冷却ソリューションとなります。この方法により、すべてのコンポーネントが確実に冷却されるだけでなく、機械的磨耗が最小限に抑えられるため、ハードウェアの寿命が延び、空気を動かす機器からの騒音も大幅に低減されます。
AI ハードウェアにおける消費電力の課題
AI システムの規模が拡大するにつれて、その電力消費はますます大きな課題となっています。 AI ハードウェア、Nvidia H100 GPUそしてブラックウェルのアーキテクチャ、電力を大量に消費することが知られており、電力要件はチップあたり最大 1200 W に達します。たとえば、22 個の 000 H100 GPU を含む一般的な AI クラスターには、最大で31メガワットの電力-小さな都市の電力消費量に相当します。
この膨大な電力需要は、データセンターの運用コストを増加させるだけでなく、環境への重大な影響にもつながります。これらの課題に対処するために、データセンターは消費電力の削減と冷却効率の向上の両方に注力する必要があります。
Nvidia の Blackwell アーキテクチャとチップ冷却への温水直接冷却
でホットチップ 2024 カンファレンス, Nvidia は、液体冷却を Blackwell アーキテクチャと統合するソリューションを発表しました。温水 Direct to Chip 冷却技術。このアプローチでは、(冷水ではなく) 温水を使用してチップから熱を直接吸収し、伝達します。温水冷却を採用することで、Nvidia はデータセンターの冷却電力消費を最大 28% 削減できます。
このソリューションの効率は 2 倍です。冷却に必要な全体的な電力を削減するだけでなく、廃熱の回収も可能になり、近くの建物の暖房など、他の用途に再利用できます。さらに、温水冷却により、チップを最適な温度範囲に保ち、過熱を防ぎ、磨耗を軽減することで、サーバーの動作寿命を延ばします。

▲温水によるチップ冷却ソリューション
GenAI や LLM などの AI アプリケーションがデータセンターに必要な計算能力を増大させ続けるため、この冷却技術は特に重要です。最適な温度を維持する機能は、AI ワークロードのパフォーマンスとスケーラビリティに直接影響し、これらのシステムが負荷の高い要求に確実に対処できるようにします。
浸漬液体冷却: 一歩先へ
直接液冷に加えて、浸漬液体冷却大規模 AI システムの次のレベルのソリューションとしても注目を集めています。この方法では、サーバー全体を非導電性の誘電性液体に浸し、すべてのコンポーネントから熱を完全に吸収して放散します。この方法でシステム全体を冷却することにより、浸漬液体冷却には次の利点があります。
- 冷却効率の向上: この方法では、すべてのコンポーネントを冷却液で囲むことにより、均一かつ効率的に熱を除去します。
- メンテナンスコストの削減: ファンなどの可動部品がないため、機械的摩耗が少なく、メンテナンスコストが削減され、機器の寿命が延びます。
- エネルギー効率の向上: 浸漬冷却は、空調システムやその他のアクティブな冷却コンポーネントの必要性を排除するため、エネルギー使用量を大幅に削減できます。

▲浸漬液冷システム
さらに、浸漬液体冷却は拡張性が高く、Nvidia の Blackwell アーキテクチャを搭載したものなど、大量の熱を発生する AI ワークロードを処理するデータ センターに最適です。大規模な AI モデルがより普及するにつれ、液浸冷却は、エネルギー コストと環境への影響を最小限に抑えながら運用を拡大したいと考えているデータ センターにとって頼りになるソリューションになる可能性があります。
シリコンバレーの冷却技術への投資
AI データセンターにおけるより効率的な冷却ソリューションに対する需要の高まりは、特にベンチャーキャピタル企業の注目を集めています。シリコンバレー。これらの企業は、以下の分野に特化したスタートアップ企業に積極的に投資しています。液体冷却この分野のイノベーションは AI ハードウェアの将来にとって不可欠であると認識しています。
開発中のスタートアップ高度な冷却ソリューションこれは、現世代の AI システムに即座にメリットをもたらすだけでなく、さらに洗練された冷却方法が必要となる可能性が高い AI ハードウェアの次の波の基礎を築くことにもなります。これらのテクノロジーは、AI システムの高電力要件と熱的課題の両方に対処する必要があるため、ハイパフォーマンス コンピューティングで可能なことの限界を押し広げたいと考えている人にとっては魅力的な投資となります。

▲AIデータセンター投資動向
結論
AI ハードウェアが進化し続けるにつれて、革新的な冷却テクノロジーの需要が高まっています。エヌビディアのブラックウェルのアーキテクチャはこの変化の最前線に立っており、温水 チップへ直接冷却して効率を高め、運用コストを削減します。液冷は、直接接触法であろうと浸漬法であろうと、最新の AI システムの膨大な電力消費と発熱を管理する最も効果的な方法であることが証明されています。
ベンチャーキャピタル企業も注目しており、多くが次世代の冷却ソリューションを提供できる新興企業に投資しています。 AI データセンターが大規模かつ複雑になるにつれて、効率的でスケーラブルな冷却システムの重要性は高まる一方であり、液体冷却は将来のハイパフォーマンス コンピューティング インフラストラクチャの基礎となります。
