Interconexiune optică de mare viteză: soluții pentru centre de date

Apr 27, 2026|

Trimestrul trecut, un client a trimis înapoi patruzeci de module 400G DR4 care revendicau clape ale legăturii aleatorii pe comutatoarele Arista 7060X5. Înainte chiar să deschidem documentele RMA, inginerul nostru de testare a pus o întrebare: ați inspectatConectori MPOinainte de instalare? Nu aveau. Am trimis modulele prin regresia noastră completă, diagramele oculare curate, BER sub 1E-13 pe toate cele patru benzi,Citirile DDM nominale. Apoi le-am rugat să trimită fotografii cu fețele de la capătul-cablului trunchiului lor sub un microscop cu fibră. Fiecare conector avea contaminare cu particule. Patruzeci de module, zero defecte. Problema era praful.

 

Vedem o versiune a acestui lucru în fiecare lună. Implementările de interconexiune optică de mare viteză la orice scară lovesc același zid, iar cifrele îl susțin: undeva între 65% și 70% din toate defecțiunile legăturilor 400G și 800G se datorează contaminarii conectorului, nu defecțiunilor transceiver-ului. (Date de câmp IEEE 802.3 prin AscentOptics) Aducem mai întâi în discuție acest lucru, deoarece încadrează modul în care gândim întreaga decizie de interconectare. Modulul nu este aproape niciodată cea mai slabă verigă. Stratul fizic din jurul lui este.

Microscopic view of an MPO fiber optic connector end-face showing severe dust and particulate contamination on the four precision glass cores of a 400G module, illustrating the number one cause of link failure.

 

Modelul dvs. de trafic decide arhitectura dvs. de interconectare optică

 

Toată lumea începe cu numărul piesei.QSFP-DD sau OSFP, SR sau DR, multimod sau unic{0}}mod. O facem și noi. Dar implementările care au mers bine pentru clienții noștri au început toate altundeva: cum arată de fapt traficul?

Antrenamentul-la scară largă AI generează comunicații-la-toate GPU care se dovedesc a fi surprinzător de previzibile pe intervale de timp de la minute la ore. Google exploatează acest lucru cu comutatoare de circuite optice în rețeaua Jupiter, reconfigurând căile luminoase fizice între rafturi în loc să schimbe pachetele. Rezultatele lor publicate dintr-un deceniu de utilizare în producție: reducere de putere cu 41%, investiții mai mici cu 30% și îmbunătățire de 50 ori a timpului de funcționare al fabricii față de arhitectura lor anterioară Clos. (Google SIGCOMM'22) Aceste cifre sunt reale, dar aparțin unei companii care a cheltuit undeva între 500 de milioane și 1 miliard de dolari pe infrastructura OCS pe parcursul a cinci ani. Am avut câțiva clienți-medii care ne-au cerut să evaluăm fezabilitatea OCS pentru mediile lor. În fiecare caz, odată ce au rulat numerele la o scară sub-500 de noduri, cerințele de capital au depășit beneficiile reconfigurarii și au rămas cu coloana vertebrală convențională folosind module conectabile.

Inferența inversează ecuația. Traficul este aglomerat și imprevizibil la nivelul fluxului, iar toleranța la latență este aproape de zero. Nu puteți reconfigura căile optice în funcție de-cerere. Ceea ce aveți nevoie este o țesătură supraprovizionată în mod constant, cu latență deterministă, care vă împinge către emițătoare-receptoare conectabile într-o topologie de tip coloană-în care fiecare legătură este întotdeauna aprinsă. Vindem module în ambele scenarii, iar conversațiile de inginerie sunt complet diferite. Cumpărătorii de grup de instruire doresc să știe despre lățimea de bandă agregată per rack și puterea pe bit. Cumpărătorii de concluzie întreabă despre latența cozii și despre ce se întâmplă atunci când un link scade.

 

Conceptual architectural diagram of a data center network topology comparing a custom Optical Circuit Switch (OCS) fabric for long-running AI training jobs versus a standard non-blocking Spine-Leaf topology for bursty inference workloads.

 

Pentru mediile tradiționale de întreprindere și colo sub hiperscală, costul pe port domină și compatibilitatea inversă cu instalația de fibră existentă contează mai mult decât densitatea brută a lățimii de bandă. Ne-am testatModule 400G QSFP-DD pe 14 platforme de comutareinclusiv Cisco Nexus 93600CD, Arista 7060X5 și Juniper QFX5220. În acele medii, preocuparea dominantă nu este viteza. Este dacă modulul este recunoscut de firmware-ul comutatorului fără comenzi de anulare manuală.

 

Zona moartă 800G care îi prinde pe ingineri neprevăzuți

 

La 400G, alegerea unei interconexiuni a fost un proces în doi-pași: măsurați distanța, alegeți cupru sau fibră. DAC pasiv a acoperit confortabil 3 până la 5 metri. 800G a spart asta. Fiecare bandă rulează 112G PAM4. Pierderea de cupru la acele frecvențe se dublează aproximativ față de 400G, iar rezultatul este un plafon dur de aproximativ 2 metri pentru cablul pasiv.

 

High-speed cable comparison showing an Active Electrical Cable (AEC) vs a standard Direct Attach Copper (DAC) bundle. The AEC uses internal retimers to extend the 800G signal reach to 7 meters at the cost of slight latency overhead.

 

Am învățat asta în mod scump. Un client timpuriu ne-a comandatAnsambluri DAC pasive 800Gîn lungimi de 3 metri, pe baza dispoziției rack-urilor de 400G. Antrenamentul de legătură a eșuat pe peste 60% dintre porturi. Cuprul nu era defect; fizica pur și simplu nu i-ar permite. Au trecut la AEC pentru rulajele de 3 până la 5 metri și module optice conectabile pentru tot ce se află dincolo, iar implementarea s-a stabilizat în decurs de o săptămână. De atunci, am încetat să mai primim comenzi pentru 800G DAC pasiv peste 2,5 metri și am adăugat un avertisment privind distanța de implementare la procesul nostru de confirmare a comenzii.

 

AEC deține acum distanța de la 3 la 7 metri. Retimerele digitale regenerează semnalul electric fără conversie optică, ceea ce reduce costurile, dar adaugă latență. Numai KP4 FEC pune 50 până la 100 de nanosecunde la fiecare hop la 800G, iar retimer-ul stă mai mult deasupra. Am măsurat latența totală adăugată la 85 până la 110 ns pe ansamblurile AEC pe care le livrăm în prezent. Pentru țesăturile-coloanei vertebrale, acea suprasarcină este invizibilă în performanța aplicației. Pentru clusterele GPU strâns cuplate, este o altă poveste. Pe baza datelor de profilare de la trei implementări ale clienților care rulează noduri H100, dacă supraîncărcarea de comunicare a jobului dvs. de antrenament este deja peste 15%, acele sute de nanosecunde suplimentare pe salt pe mai multe niveluri de comutare începe să se agraveze în operațiunile NCCL AllReduce.

 

Dincolo de 7 metri, transceiverele optice conectabile pentru 800G sunt singura cale viabilă. Solicitările stratului fizic se strâng considerabil aici. Bugetele de pierdere de inserție de la -} până la-termină conform IEEE 802.3ck ajung sub 1,5 dB pentru majoritatea claselor de acoperire 800G, iar fiecare conexiune MPO cuplată trebuie să rămână sub 0,35 dB. Am văzut că fibrele instalate care au trecut certificarea la 100G arată valori PMD de două până la trei ori peste specificațiile nominale după câțiva ani de compresie în suporturi de cablu, în concordanță cu ceea ce echipa de cercetare a rețelei Juniper a raportat în 2023. Recomandarea noastră standard înainte de orice implementare a unui transceiver 800G: rulați caracterizarea OTDR și PMD pe fiecare segment de fibră existent. Nu o mostră. Fiecare segment. Costul re-tragării a două cabluri trunchiuri este o fracțiune din costul depanării clapetelor de legătură intermitentă timp de șase luni.

 

CPO vs LPO vs Pluggable: unde se află de fapt fiecare tehnologie în 2026

 

Optica co-ambalată va schimba modul în care este construită infrastructura de comutare a centrelor de date. Spunem acest lucru în calitate de producător de module conectabile, așa că luați punctul nostru de vedere ca fiind informat, mai degrabă decât neutru.

 

La OFC 2026, datele de fiabilitate privind prototipurile CPO au arătat rate de eșec potențial mai mici decât modulele conectabile tradiționale. Fără cicluri de inserare mecanică sau suprafețe expuse conectorilor, modurile de defectare dominante ale modulelor conectabile pur și simplu nu se aplică. Platforma de comutare Bailly 51.2T CPO de la Broadcom a demonstrat consumul de energie cu aproximativ 70% mai mic pe stratul optic în comparație cu configurațiile conectabile echivalente. (Raport de interconectare optică DataMIIntelligence) NVIDIA a prezentat comutatoare CPO-integrate la GTC 2026, care vizează implementarea extinsă-în fereastra 2027-2028.

 

Poziția noastră: dacă nu sunteți un hyperscaler care construiește comutator personalizat de silicon, optica conectabilă este singura dvs. opțiune implementabilă până în 2027. CPO are nevoie de arhitecturi de plăci pe care majoritatea furnizorilor de switch-uri nu au fost livrate încă, standarde de conector care nu sunt finalizate și un manual complet nou pentru gestionarea defecțiunilor pe care nu le puteți remedia prin tragerea unui modul. Ecosistemul pentru achizițiile generale pentru întreprinderi nu există încă. În ultimul an, doi clienți potențiali și-au întârziat upgrade-urile de la 400G-la 800G în așteptarea CPO. Ambii s-au întors în cele din urmă și au plasat comenzi conectabile după ce lipsurile lor de lățime de bandă au devenit incidente de producție. Am scris mai detaliat despre rațiunea inginerească pentru această pozițieanaliza arhitecturii transceiver conectabil.

 

LPO se află într-un spațiu diferit. Îndepărtarea DSP-ului din modul elimină componenta cu cea mai mare consumație de energie-, responsabilă pentru până la jumătate din consumul total de energie al modulului. Rezultatul este un consum mai mic cu 30 până la 50% și o latență mai mică cu până la 15 nanosecunde. Am început să lansăm cereri de cerere specifice LPO-la sfârșitul anului 2025. Trei dintre cele patru au venit de la clienți care construiau clustere GPU cu un singur-furnzor pe NVIDIA Spectrum-X. Niciunul nu a operat țesături cu mai mulți-furnizori, ceea ce vă spune totul despre locul în care funcționează LPO astăzi. Dacă rețeaua dvs. amestecă furnizori comutatori, LPO nu este compatibil cu mediul dvs. Dacă rulați un singur cluster AI de-furnizor, ar putea fi cea mai inteligentă actualizare disponibilă și ne așteptăm să avem module pregătite LPO-în calificare până la jumătatea anului 2027.

Ce înseamnă marjele termice 800G pentru selectarea modulelor

 

Matematica termică la 800G îi prinde pe oameni pe nepregătite. Densitatea puterii de interconectare optică de mare viteză la această generație creează probleme care pur și simplu nu existau la 400G. Un comutator cu 64 de porturi complet încărcat cu module de 800G la 16W fiecare consumă aproximativ 1kW numai în puterea transceiver-ului, înainte ca comutatorul ASIC propriul 400 până la 500W. Adică 1,4 până la 1,5 kW per comutator. Opt comutatoare într-un strat de coloană vă oferă peste 11 kW numai din echipamentele de rețea, în rafturi care au fost adesea prevăzute pentru 8 până la 10 kW în total.

 

Juniper Networks avertizează în mod explicit că modulele terțe-cu consum mare de putere, în special tipurile ZR și ZR+ coerente, pot provoca daune termice echipamentelor gazdă, iar responsabilitatea revine utilizatorului. (Întrebări frecvente despre Juniper Networks 800G Optics) Acesta nu este un argument împotriva modulelor optice-terte. Este un argument pentru a ști exact la ce conectați. În calificarea noastră pentru ciclism termic, testăm fiecare design al modulului 800G la o temperatură susținută de joncțiune de 85 de grade timp de 2.000 de ore și urmărim deviația curentului de polarizare laser ca indicator primar de îmbătrânire. Unitățile care derivă peste 38 mA sunt scoase din linia de producție. La densități de 800 G, diferența dintre un modul de desen de 14 W și un desen de 18 W determină dacă un rack rămâne în interiorul anvelopei termice sau declanșează alarme de oprire la 2 AM. A greșit specificațiile a fost întotdeauna enervant. La aceste niveluri de putere, este scump.

Thermal heatmap of a high-density switch rack illustrating extreme heat concentration in the transceiver cage area where 64 modules drawing 16W each generate significant thermal load, nearing cooling capacity limits.

 

 

Livrăm module conectabile de la 1G SFP la 800G OSFP și testăm pe platformele majore de comutare. Păstrăm înregistrări despre ceea ce funcționează și ce nu. Dacă aveți nevoie de o verificare a compatibilității cu un anumit mediu de comutare sau doriți specificații de clasă termică și de putere-pentru rafturi de-densitate mare 800G, inginerii noștri rulează acele conversații în fiecare săptămână. NoastrePagina transceiver 800G OSFP și QSFP-DD800are specificații, opțiuni de acoperire-clasă și exemple de formulare de solicitare pentru fiecare modul pe care îl livrăm.

Trimite anchetă