Големият срив на Google Cloud в четвъртък, 12 юни, засегна широк кръг услуги на Google и платформи на трети лица, сред които Spotify, Snapchat, NPM, Firebase, Discord и Cloudflare. Аварията стартира около 15:49 ч. BG време и беше напълно овладяна около 20:49 ч., след като предизвика смущения в множество услуги в продължение на повече от 3 часа.
Какво предизвика срива?
Според Google проблемът произлиза от платформа за API управление на Google Cloud. В системата погрешно са внедрени правила за автоматични лимити, което води до отказ на всички външни API заявки. В резултат на това услугите на Google Cloud, сред които Gmail, Calendar, Drive, Docs и Meet, също изпадат в неизправност.
От компанията съобщават, че главната причина за срива се корени в невалидно автоматично увеличение на квотите, прилагано към API управлението. В повечето региони проблемът беше сметнат и заобиколен чрез премахване на съответната функция, но в американския район us-central1 възстановяването беше по-бавно поради претоварване на базите с правила.
Въздействие и смущения при Cloudflare
Не само услуги на Google бяха засегнати. Редица платформи, сред които Cloudflare, изпитаха смущения, тъй като съхранението на ключове и стойности (Workers KV) на Cloudflare зависи изцяло от Google Cloud.
Говорител на Cloudflare потвърди, че не става въпрос за пробив в сигурността, а за технически проблем при третия им партньор — Google Cloud. Вследствие на срива Cloudflare обяви, че премества главната база на KV към собствения си продукт R2, с цел да намали зависимостите си и да избегне подобни събития в бъдеще.
Какво съобщиха компаниите?
Google изрази съжаление за събитията с изявление:
„Бизнесите по света разчитат на Google Cloud. Извиняваме се искрено за смущенията и ви уверяваме, че правим всичко възможно да избегнем подобни събития занапред.”
Заключение
Големият технически срив показа колко взаимно свързан и уязвим може да бъде съвременният интернет. В същото време той дава повод на платформи като Cloudflare да потърсят по-надеждни и устойчиви подходи, с които да намалят влиянието на единични откази в облака върху всички услуги, използващи съответната инфраструктура.









