課題
LLM搭載の製品を構築するAIスタートアップは,生産レベルの推論インフラストラクチャを迅速に必要とした.チームは,長いGPUリードタイム,緊密な予算,および内部データセンターの経験がないことに直面した.設定できるサプライヤーが必要でしたテストし 実行可能なクラスタを配達します
解決策
顧客はデルのGPUサーバーを選びました
- Intel Xeon スケーラブルプロセッサ 高コア数オプション
- 1つのノードあたり複数のNVIDIAクラスのGPU,予算に合わせてサイズ
- 高周波DDR5メモリとNVMeストレージ
- プリインストールOSと検証されたドライバーを私たちのラボから
各ノードが発送前に 燃やされ ストレステストを受け 配達計画を段階的に作りました チームが最初のノードで テストを開始し 残りのノードが到着するまで
結果
- クラスターは,7週間で展開されます.
- 前回の単一GPU設定と比較して 10%減った推論遅延
- 24ヶ月間相当のクラウド GPU インスタンスをリースするよりも10%のコスト削減
鍵 の 知識
最初のクラスターのサイズを決めるのは 最大のクラスターを買うよりも重要です工場直結のハードウェアと 需要が増加するにつれてスケーリング このスタートアップが過剰な資本を投入せずに稼働させてください.
AIの推論や訓練インフラストラクチャを 計画するために