高速光インターコネクト: データセンター ソリューション

Apr 27, 2026|

前四半期、お客様から Arista 7060X5 スイッチでランダムなリンク フラップが発生したとして、40 個の 400G DR4 モジュールが返送されました。 RMA 書類を開封する前に、テスト エンジニアは 1 つの質問をしました。MPOコネクタインストール前?彼らはそうではありませんでした。完全な回帰を経てモジュールを送信し、アイ ダイアグラムはクリーンで、4 つのレーンすべてで BER は 1E-13 未満でした。DDM 測定値(公称値)。次に、ファイバー顕微鏡でトランク ケーブルの端面の写真を送ってもらうよう依頼しました。-どのコネクタにも粒子状の汚染がありました。 40 個のモジュール、欠陥なし。問題は粉塵でした。

 

これの何らかのバージョンが毎月表示されます。高速光インターコネクトの展開は、どのような規模であっても同じ壁にぶつかりますが、それを数字が裏付けています。400G および 800G リンク障害全体の 65% ~ 70% は、トランシーバーの障害ではなく、コネクタの汚染に遡ります。 (AscentOptics 経由の IEEE 802.3 フィールド データ) これを最初に取り上げるのは、相互接続の決定全体についての考え方の骨子となるからです。モジュールが最も弱いリンクになることはほとんどありません。その周りの物理層です。

Microscopic view of an MPO fiber optic connector end-face showing severe dust and particulate contamination on the four precision glass cores of a 400G module, illustrating the number one cause of link failure.

 

トラフィック パターンが光インターコネクト アーキテクチャを決定します

 

誰もが部品番号から始めます。QSFP-DD または OSFP、SR または DR、マルチモードまたはシングルモード。-私たちもそうします。しかし、お客様にとってうまくいった導入はすべて別の場所から始まりました。実際のトラフィックはどのようなものでしょうか?

大規模な AI トレーニングでは、-対-の GPU 通信が生成され、数分から数時間のタイムスケールで驚くほど予測可能であることが判明しました。 Google は、Jupiter ネットワーク内の光回線スイッチでこれを利用し、パケットをスイッチングする代わりにラック間の物理的な光パスを再構成します。同社が公表した 10 年間の実稼働環境の結果は、以前の Clos アーキテクチャと比較して、電力が 41% 削減され、設備投資が 30% 削減され、ファブリックの稼働時間が 50 倍向上しました。 (Google SIGCOMM'22) これらの数字は実際のものですが、5 年間で OCS インフラストラクチャに 5 億ドルから 10 億ドルを費やした企業のものです。少数の中規模のお客様から、自社の環境における OCS の実現可能性を評価してほしいとの問い合わせがありました。-いずれの場合も、500 ノード未満の規模で数値を実行すると、資本要件が再構成のメリットを上回り、プラグ可能モジュールを使用した従来のスパインリーフのままになりました。

推論によって方程式が逆転します。トラフィックはバースト的でフロー レベルでは予測不可能であり、遅延許容度はゼロに近くなります。リクエストごとに光パスを再構成することはできません。-必要なのは、確定的なレイテンシを備えた一貫したオーバープロビジョニングのファブリックであり、これにより、すべてのリンクが常に点灯するスパイン{4}}リーフ トポロジでプラグイン可能なトランシーバーを使用するようになります。私たちは両方のシナリオにモジュールを販売していますが、エンジニアリングに関する会話はまったく異なります。トレーニング クラスターの購入者は、ラックあたりの総帯域幅とビットあたりの電力について知りたいと考えています。推論購入者は、テール レイテンシと、リンクがダウンしたときに何が起こるかについて尋ねます。

 

Conceptual architectural diagram of a data center network topology comparing a custom Optical Circuit Switch (OCS) fabric for long-running AI training jobs versus a standard non-blocking Spine-Leaf topology for bursty inference workloads.

 

ハイパースケール以下の従来のエンタープライズおよびコロニー環境では、ポートあたりのコストが支配的であり、既存のファイバー プラントとの下位互換性が生の帯域幅密度よりも重要になります。私たちはテストしました14 のスイッチ プラットフォームにわたる 400G QSFP-DD モジュールCisco Nexus 93600CD、Arista 7060X5、Juniper QFX5220 など。このような環境では、主な懸念は速度ではありません。それは、モジュールが手動オーバーライド コマンドなしでスイッチ ファームウェアによって認識されるかどうかです。

 

エンジニアの不意を突く 800G デッドゾーン

 

400G では、相互接続の選択は 2 段階のプロセスでした。距離を測定し、銅線またはファイバーを選択します。-パッシブ DAC は 3 ~ 5 メートルを快適にカバーしました. 800G はそれを破りました。各レーンは 112G PAM4 を実行します。これらの周波数での銅損は 400G と比較して約 2 倍になり、その結果、パッシブ ケーブルの長さは約 2 メートルに制限されます。

 

High-speed cable comparison showing an Active Electrical Cable (AEC) vs a standard Direct Attach Copper (DAC) bundle. The AEC uses internal retimers to extend the 800G signal reach to 7 meters at the cost of slight latency overhead.

 

私たちはこれを高価な方法で学びました。初期のお客様が当社にご注文いただきました800G パッシブ DAC アセンブリ400G ラック レイアウトに基づいて 3 メートルの長さです。 60% 以上のポートでリンク トレーニングが失敗しました。銅に欠陥はありませんでした。物理学がそれを許しません。 3 ~ 5 メートルの距離では AEC に切り替え、それを超える部分ではプラグイン可能な光モジュールに切り替え、導入は 1 週間以内に安定しました。それ以来、2.5 メートルを超えるパッシブ 800G DAC の注文受付を停止し、注文確認プロセスに展開距離に関する勧告を追加しました。

 

AEC は現在 3 ~ 7 メートルのギャップを所有しています。デジタル リタイマーは光変換を行わずに電気的に信号を再生成するため、コストは抑えられますが、遅延が増加します。 KP4 FEC だけでは、800G で各ホップに 50 ~ 100 ナノ秒がかかり、リタイマーはさらに上にスタックされます。現在出荷している AEC アセンブリの合計追加遅延を 85 ~ 110 ns で測定しました。スパイン-リーフ ファブリック リンクの場合、そのオーバーヘッドはアプリケーションのパフォーマンスには現れません。密結合された GPU クラスターの場合は別の話になります。 H100 ノードを実行している 3 つの顧客導入からのプロファイリング データに基づくと、トレーニング ジョブの通信オーバーヘッドがすでに 15% を超えている場合、複数のスイッチ層にわたるホップあたりの余分な 100 ナノ秒が NCCL AllReduce 操作で悪化し始めます。

 

7 メートルを超えると、800G 対応のプラグイン可能な光トランシーバーが唯一の実行可能なパスになります。ここでは物理層の要求が大幅に厳しくなります。 IEEE 802.3ck におけるエンドツーエンドの挿入損失バジェットは、ほとんどの 800G 到達クラスで 1.5 dB 未満に抑えられており、すべての嵌合 MPO 接続は 0.35 dB 未満にとどまる必要があります。-- 100G で認証に合格した設置済みのファイバーは、ケーブル トレイで数年間圧縮した後、定格仕様を 2 ~ 3 倍上回る PMD 値を示すことが確認されています。これは、ジュニパーのネットワーク研究チームが 2023 年に報告した内容と一致しています。800G トランシーバーを導入する前に、既存のすべてのファイバー セグメントで OTDR および PMD の特性評価を実行することを標準推奨しています。サンプルではありません。すべてのセグメント。 2 本のトランク ケーブルを再度引くコストは、断続的なリンク フラップを 6 か月間デバッグするコストのほんの一部です。-

 

CPO 対 LPO 対プラガブル: 2026 年の各テクノロジーの実際の位置

 

-光ファイバーの共同パッケージ化により、データセンターのスイッチング インフラストラクチャの構築方法が変わります。私たちはプラガブル モジュールのメーカーとしてこれを述べているため、私たちの見解は中立的なものではなく、情報に基づいたものであると考えてください。

 

OFC 2026 では、CPO プロトタイプの信頼性データにより、故障率が従来のプラグ可能モジュールよりも低い可能性があることが示されました。機械的な挿入サイクルや露出したコネクタ表面がなければ、プラグ可能モジュールの主な故障モードは適用されません。 Broadcom の Bailly 51.2T CPO スイッチ プラットフォームは、同等のプラガブル構成と比較して、光レイヤでの消費電力が約 70% 低いことを実証しました。 (DataMIntelligence 光インターコネクト レポート)NVIDIA は、2027 年から 2028 年の期間で導入をスケールアップすることを目標に、GTC 2026 で-CPO 統合スイッチを披露しました。-

 

私たちの立場: カスタム スイッチ シリコンを構築するハイパースケーラーではない場合、少なくとも 2027 年まで導入可能な唯一のオプションはプラガブル オプティクスです。 CPO には、ほとんどのスイッチ ベンダーがまだ出荷していないボード アーキテクチャ、最終決定されていないコネクタ規格、およびモジュールをプルしても修正できない障害を処理するためのまったく新しいプレイブックが必要です。一般的な企業調達のエコシステムはまだ存在していません。過去 1 年間に 2 件の見込み顧客が、CPO を待って 400G- へのアップグレードを延期しました。帯域幅のギャップが生産上のインシデントとなった後、最終的には 2 人とも戻ってきて、プラガブルな注文を出しました。このポジションのエンジニアリングの理論的根拠については、プラガブル トランシーバー アーキテクチャ分析.

 

LPOは別の空間にあります。モジュールから DSP を取り外すと、モジュールの総消費電力の最大半分を担う、最も電力を消費する 1 つのコンポーネントが削減されます。-その結果、消費量が 30 ~ 50% 削減され、レイテンシが最大 15 ナノ秒短縮されます。当社は、2025 年後半に LPO{7}} 固有の RFQ への対応を開始しました。4 件のうち 3 件は、NVIDIA Spectrum-X 上で単一ベンダーの GPU クラスタを構築している顧客からのものでした。{9}マルチベンダーのファブリックを運用している人はいませんでした。これにより、LPO が今日どこで機能しているかがすべてわかります。ネットワークにスイッチ ベンダーが混在している場合、LPO は環境と互換性がありません。単一ベンダーの AI クラスタを実行する場合、これが利用可能な最も賢明なアップグレードになる可能性があり、2027 年半ばまでに LPO 対応モジュールが認定される予定です。-

800G の熱マージンがモジュール選択に何を意味するか

 

800G での熱計算は人々を不意を突くものです。この世代の高速光インターコネクトの電力密度により、400G では存在しなかった問題が生じます。 16 W の 800G モジュールをフル搭載した 64 ポート スイッチは、スイッチ ASIC 自体の 400 ~ 500 W の前に、トランシーバだけで約 1 kW の電力を消費します。これは、スイッチあたり 1.4 ~ 1.5 kW になります。スパイン層内の 8 つのスイッチにより、合計 8 ~ 10 kW にプロビジョニングされることが多いラックでは、ネットワーク機器だけで 11 kW 以上の電力を供給できます。

 

ジュニパー ネットワークスは、消費電力の高いサードパーティ モジュール、特にコヒーレント ZR および ZR+ タイプは、ホスト機器に熱による損傷を引き起こす可能性があり、その責任はユーザーにあることを明確に警告しています。{0} (ジュニパーネットワークス 800G オプティクスに関するよくある質問)これは、サードパーティ製の光学モジュールに対する議論ではありません。-これは、何を接続しているかを正確に知るための議論です。当社の熱サイクル認定では、すべての 800G モジュール設計をジャンクション温度 85 度で 2,000 時間継続してテストし、主な経年劣化指標としてレーザー バイアス電流のドリフトを追跡します。 38 mA を超えてドリフトするユニットは生産ラインから取り外されます。 800G 密度では、1 つのモジュールの描画 14 W と 1 つのモジュールの描画 18 W の差によって、ラックが熱エンベロープ内に収まるか、午前 2 時にシャットダウン アラームがトリガーされるかが決まります。仕様を間違えるのはいつも面倒なことです。このような電力レベルでは、コストが高くなります。

Thermal heatmap of a high-density switch rack illustrating extreme heat concentration in the transceiver cage area where 64 modules drawing 16W each generate significant thermal load, nearing cooling capacity limits.

 

 

当社は 1G SFP から 800G OSFP までのプラグ可能モジュールを出荷し、主要なスイッチ プラットフォームに対してテストを行っています。私たちは何がうまくいき、何がうまくいかないのかを記録します。特定のスイッチ環境に対する互換性チェックが必要な場合、または高密度 800G ラックの熱および電力クラスの仕様が必要な場合、-我々 のエンジニアが毎週そのような会話を行います。-私たちの800G OSFP および QSFP-DD800 トランシーバーのページには、出荷するすべてのモジュールの仕様、リーチクラス オプション、サンプル リクエスト フォームが記載されています。-

Send Inquiry