
昨今、AIに関連するインフラといえば、真っ先にGPUやアクセラレータクラスタ、高帯域幅メモリが思い浮かぶでしょう。そして、それらは確かに注目に値するものです。AIモデルが適切に機能するためには、膨大な演算能力と極めて高いメモリ帯域幅が必要です。しかし、ここでは舞台裏にあるすべて、つまりAIクラスタを円滑に稼働させ、管理しやすくし、今後何年にもわたってその役割を果たせるだけの信頼性を確保するインフラについてお話ししたいと思います。
実のところ、AIデータセンターは単なるアクセラレータやペタバイト級の高速ストレージだけではありません。それは、プロセス全体にとってそれぞれ不可欠な、多くの異なるコンポーネントから構成される「生きているエコシステム」なのです。 そして、これらのコンポーネントのほとんどは、何らかの形でフラッシュストレージを必要としています。これは、モデルやデータセットの保存に私たちが普段使っているようなフラッシュストレージではなく、ブートコード、ファームウェア、設定、ログ、セキュリティ、テレメトリデータを保存するために必要なフラッシュストレージです。フラッシュストレージがなければ、AIクラスターを機能させるための周辺インフラは、その役割を果たすことができません。
AIデータセンターといえばGPUがずらりと並んでいるイメージがありますが、実際には、最終的なソリューションを提供するために相互接続された多くの異なるシステムで構成される、複雑で多層的な環境です。ストレージシステムは、LustreやGPFSなどの並列ファイルシステムのバックボーンであり、フラッシュストレージを活用して高スループットのデータストライピングとデータ配信を実現しています。メタデータサーバーもまた、ストレージサーバーを補完するシステムの一つであり、フラッシュストレージを活用して高性能なファイル操作やネームスペース情報を提供しています。
GPU コンピューティングノード自体も、ブート、オペレーティングシステム、ドライバースタック、プロビジョニングアーティファクト、コンテナランタイム、および診断ログのためにローカルフラッシュに依存しています。しかし、AI アーキテクチャがより複雑になるにつれ、これは DPU、SmartNIC、およびその他のインフラストラクチャアクセラレータにも当てはまります。これらは、ファームウェアバンドル、小型オペレーティングシステム、マイクロハイパーバイザー、あるいはネットワーク設定や構成情報を保存するために、ローカルの e.MMC や小型フォームファクタの NVMe ソリューションを利用することがよくあります。
このエコシステムの2つ目の重要な構成要素は、管理スタックです。ベース管理コントローラ(BMC)は、自身のファームウェア、RedfishやIPMIサービス、さらにはリカバリ環境のためにローカルフラッシュを利用しています。数千台のノードの監視やオーケストレーションにおいて、その高可用性は明らかに不可欠です。ネットワークに関しては、イーサネットやInfiniBandスイッチも、自身のオペレーティングシステム、スイッチの状態設定、さらにはスイッチのファームウェアを保存するために、独自のローカルフラッシュを利用しています。
最後に、これらすべての上に位置するのがクラスターの論理制御プレーンであり、これも同様にストレージに大きく依存しています。管理サーバやオーケストレーションサーバーは、状態情報、スケジューリングメタデータ、プロビジョニング、さらには自動化のために、信頼性の高い低遅延SSDを利用しています。また、鍵管理、ポリシー定義、さらにはロールバック情報を保存するセキュリティソリューションもあり、これらすべてが信頼性が高く信頼できるストレージソリューションに依存しています。
運用インサイトを提供するノード(可観測性、テレメトリ、さらにはロギングノードなど)でさえ、膨大な量のメトリクス、インデックス、さらにはイベントをローカルフラッシュに絶えず書き込んでいます。これらのノードの本来の目的は、信頼性の高い書き込みパフォーマンスを提供するストレージの可用性によって定義されています。
これらの要素を総合的に見ると、ある明確な実態が浮かび上がります。たとえ決してベンチマークチャートや製品発表に表れることはないとしても、AIデータセンターには、膨大なサブシステムのエコシステムが必要であり、そのすべてが最高水準のフラッシュストレージソリューションを必要としているのです。
AIは巨大なデータセンターで飛躍的に成長している一方で、ソースに近いエッジでも同様に成長しています。エッジAIサーバーは、工場、小売店舗、さらには都市部においてAI推論を実行します。エッジAIサーバーは、ライブカメラ映像やマシンデータに対してリアルタイムで推論を実行します。これにより、クラウドへの依存度が低減され、プライバシー保護も強化されます。
フラッシュストレージは、こうしたエッジAIサーバーにおいて重要な役割を果たします。エッジAIサーバーには、リアルタイムのデータバッファリングとキャッシュ処理が求められます。ストレージデバイスは、データをキャッシュし、これらのエッジ環境においてデータの一時的な保持性を確保する必要があります。さらに、エッジ環境では電源供給が不安定であったり、高温条件下で動作したりする場合もあります。そのため、ストレージデバイスは高い信頼性を備え、こうした条件下でも一貫したパフォーマンスを発揮することが求められます。
ツールセットの一部となる機能としては、データ保持、ハードウェア暗号化、リモート管理機能、停電保護、耐久性などが挙げられます。しかし、エッジ環境において、ストレージデバイスには単に高速である以上のことが求められます。ストレージデバイスには、信頼性が求められているのです。
データセンターからエッジに至るまで、フラッシュストレージは、極端な温度範囲での安定性、ログやテレメトリデータに対する持続的な書き込み性能、メタデータアクセスやブートコードに対する強力な低遅延性能、停電時のデータ整合性など、複雑な一連の要件を満たす必要があります。また、BMCからエッジゲートウェイまであらゆるものをサポートするための多種多様なフォームファクタに加え、セキュアなファームウェア管理やハードウェア暗号化もますます重要になっています。
そしてもちろん、必要なのは産業用グレードのフラッシュストレージです。民生用ではありません。絶え間ない使用、極端な温度環境、書き込み集約型のワークロードといった要件 ― これらはAIデータセンターとエッジ環境の両方を特徴づける要件ですが、それら満たせるのは産業用グレードのフラッシュストレージだけです。
まず第一に、当社の強みは、AIシステムの 「舞台裏」 に自然に適合しています。当社の長い製品ライフサイクルと固定されたBOM(部品表)アプローチにより、まったく同じコンポーネントが長年にわたり確実に供給されることが保証されます。これは、AIによってコンポーネントの需要変動が生じうる環境において、大きな強みとなります。
また、当社は厳格に管理された、主に欧州を拠点とするサプライチェーンを有しています。当社の製品はすべてトレーサビリティが確保、安全に製造され、サプライチェーン攻撃から保護されています。AIシステムがITインフラのますます重要な構成要素となり、それに伴い信頼性や規制遵守に対する要件が高まっている環境において、これはますます重要な要素となっています。
そしてもちろん、産業用、組み込み、エッジストレージ分野における数十年にわたる経験をもとに、当社はAIシステムの性能、耐久性、信頼性の要件を満たすフラッシュストレージソリューションも提供しています。これらは、BMCから高性能テレメトリシステム、堅牢なエッジサーバーに至るまで、あらゆるシステムを裏側で支えています。
AIにおけるブレークスルーは、多くの場合、AIコンピューティングの進歩 ― 強力なGPUやHBMなどの最先端メモリ技術などによって牽引されています。しかし、AIにはそれ以上の要素が数多く存在します。実際、現実の世界では、AIシステムは数十もの個々のコンポーネントで構成されており、その一つひとつに堅牢なフラッシュストレージが不可欠です。フラッシュストレージがなければ、AIシステムは機能などしません。
Swissbitは、堅牢で長寿命、かつ安全な産業用ストレージソリューションを提供することで、現代のAIインフラが築かれる基盤を支えています。裏方としてひっそりと機能しているかもしれませんが、AIシステムの信頼性を高め、安定させ、将来に備えた状態を維持させられるよう大きく貢献しているのです。
当社の専門家が喜んでお手伝いいたします。
Receive the latest news and announcements about storage and security solutions as well as current events and new products.