Amazonov globalni izpad v oblaku: časovnica, vzrok in obseg

  • Globalni incident AWS z epicentrom v US-EAST-1, ki se je začel okoli 9.00 (polotoški čas)
  • Amazon je zaznal vir v DynamoDB in osnovno težavo DNS, ki se je do poldneva postopno obnovila.
  • Vpliv na več storitev: Alexa, Prime Video, Canva, Duolingo, Snapchat in videoigre, kot sta Fortnite in Roblox
  • Specifični vplivi so se nadaljevali tudi popoldne, medtem ko so se izvajali blažilni ukrepi.

Splošna slika globalnega izpada AWS

Obsežen izpad, ki je prizadel infrastrukturo Amazon Web Services (AWS), je občasno motil delovanje tisočih platform in aplikacij v različnih državah. Število uporabniških poročil o težavah s povezljivostjo, zakasnitvah in neuspešnih nalaganjih se je zgodaj zjutraj povečalo , še posebej v Združenih državah Amerike, vidne posledice pa so bile v Evropi.

Glede na stanje na nadzorni plošči podjetja je težava nastala v regiji US-EAST-1 (Severna Virginija) in povzročila nenavaden porast stopenj napak v več API-jih. Do sredine dopoldneva je AWS poročal o jasnih znakih okrevanja v številnih storitvah, čeprav so ekipe še vedno delale na popolni rešitvi težave in obnovi vseh operacij v normalno stanje.

Kronologija incidenta

Prva opozorila so se pojavila okoli 9. ure zjutraj (po španskem polotoku), kmalu zatem pa je bilo največ incidentov, kmalu zatem pa so se začela pojavljati stalna obvestila na orodjih za spremljanje, kot je DownDetector. Od 11. ure naprej je podjetje poročalo, da je odkrilo možen vzrok in začelo izvajati blažilne ukrepe, ki so pospešili okrevanje na različnih ravneh.

Okoli poldneva je AWS poročal, da se večina operacij vrača v normalno stanje , čeprav je opazil občasne omejitve pri določenih zahtevah in specifičnih storitvah na prizadetem območju. V zgodnjem popoldnevu so se še vedno čutili preostali učinki , saj so se prizadevanja za stabilizacijo nadaljevala.

Ilustracija težav v Amazonovem oblaku

Kje je bil tehnični izvor

Podjetje se je osredotočilo na Amazon DynamoDB , svojo storitev upravljane baze podatkov ključ-vrednost, katere končna točka v US-EAST-1 je imela napake, ki so povzročile kaskadne napake v več odvisnostih. AWS je kot sprožilec navedel osnovno težavo DNS , ki so jo odpravljali postopno.

V praksi, ko sistem domenskih imen (DNS) ne uspe pravilno razrešiti, aplikacije ne morejo najti svojih virov , kar povzroči napake pri povezavi, časovne omejitve in napake pri nalaganju podatkov. Kot ukrep za nepredvidene razmere je AWS strankam, ki imajo trajne težave, priporočil, da izpraznijo predpomnilnik DNS , da se razrešitev obnovi na pravilne končne točke.

Kdo je bil prizadet

Vpliv je bil zelo razširjen: Amazon je poročal o težavah z Alexo in Prime Video , medtem ko so imele težave tudi storitve tretjih oseb, kot so Canva , Duolingo in Snapchat . Izpadi so bili opaženi tudi pri generativnih platformah umetne inteligence in sodelovalnih aplikacijah, ki se zanašajo na oblak AWS.

Tudi digitalni zabavi ni bilo prizaneseno. Igre in storitve z veliko uporabniško bazo, kot so Fortnite , Roblox in Clash Royale , so poročale o napakah pri prijavi ali povezljivosti, nekatere trgovine z igrami in zaganjalniki pa so uvedle ukrepe za zmanjšanje vpliva, dokler se promet ni stabiliziral.

Vpliv v Španiji

Številni uporabniki po vsej državi so poročali o težavah pri dostopu do aplikacij in spletnih mest digitalnih storitev, zlasti okoli sredine dopoldneva. Prizadete so bile tudi platforme za prodajo vstopnic, kot je Ticketmaster, zaradi česar so se izdaje, predvidene za opoldne, vključno z vstopnicami za težko pričakovane koncerte, zavlekle.

Finančne institucije in večje potrošniške platforme so poročale o posameznih incidentih v svojih spletnih sistemih, čeprav se je vpliv razlikoval glede na regijo in storitev. Medtem ko so bili v prizadeti regiji ZDA uvedeni blažilni ukrepi, je bilo v Evropi opaženo postopno okrevanje dostopa.

Trenutno stanje in priporočila

Z minevanjem ur je AWS nakazal, da opaža znatne znake okrevanja pri večini svojih storitev, hkrati pa ohranja omejene omejitve pri nekaterih operacijah znotraj US-EAST-1. Podjetje še naprej spremlja delovanje in izvaja prilagoditve za popolno rešitev težave.

Če še vedno prihaja do posameznih napak, je priporočljivo preveriti uradno stanje AWS in po potrebi počistiti predpomnilnik DNS ali znova zagnati odjemalce in storitve, ki so odvisne od ločljivosti končnih točk v prizadetem območju. Pri kritičnih uvedbah je priporočljivo preveriti tudi preklope ob okvari , omrežne odvisnosti in pravilnike za ponovni poskus, da se čim bolj zmanjša vpliv zakasnitve in prehodnih napak.

Epizoda poudarja, v kolikšni meri je infrastruktura računalništva v oblaku postala strukturna za digitalno gospodarstvo: lokalizirana napaka v ključnem vozlišču se lahko spremeni v verižne reakcije na svetovni ravni, od pretakanja in video iger do finančnih in produktivnostnih aplikacij.


Dodaj kot prednostni vir v Googlu