Uber가 클라우드 마이그레이션의 장애물을 제거하면서 네트워크 신뢰성을 향상시킨 방법

구글 인사이트

by Miyeon. Jo

Uber는 도시의 모습과 참 닮아있습니다. 둘 다 끊임없이 변화하고 성장하며, 이로 인해 발생하는 트래픽을 세심하게 관리해 정체와 불필요한 확장을 막아야 하기 때문입니다.

Uber는 글로벌 네트워크 확장에 발맞춰 기술 전략을 지속적으로 진화시켜 왔습니다. 이러한 신중한 계획과 끊임없는 개선 덕분에 전 세계 플랫폼을 아우르는 애플리케이션 트래픽을 원활하게 유지할 수 있었습니다. 결국 언제 어떤 상황에서도 끊김 없는 고성능 플랫폼을 유지하는 것이 고객의 신뢰를 지키는 핵심 열쇠입니다.

이러한 노력의 중심에는 Cloud Interconnect의 Application Awareness 솔루션이 있었습니다. 업계 최초로 하이브리드 네트워크 전반에서 애플리케이션 우선순위를 지정할 수 있는 이 기능 덕분에, Uber는 잠재적인 네트워크 정체(Congestion) 이벤트 발생 시에도 비즈니스 핵심 트래픽을 우선 처리하여 업무 연속성(Business Continuity)을 확보할 수 있었습니다.

Uber는 Cloud Interconnect의 Application Awareness 초기 디자인 파트너로 참여하여, 이 기능이 Uber 수준의 대규모 글로벌 운영 요구사항을 완벽히 충족하도록 도왔습니다. 이는 일상적인 운영을 개선했을 뿐만 아니라, 서비스 전환(Switchover) 과정에서의 중단 리스크를 줄임으로써 Google Cloud 마이그레이션을 자신 있게 추진할 수 있는 계기가 되었습니다.

본 아티클에서는 Uber가 가장 필요로 했던 기능과 그 이유, Cloud Interconnect의 Application Awareness 작동 원리, 그리고 이 기능이 다른 기업들에게 어떻게 도움이 될 수 있는지 공유합니다.

핵심 트래픽 우선순위 지정

글로벌 규모로 분산(Distributed), 하이브리드 또는 멀티클라우드 애플리케이션을 마이그레이션할 때 네트워크 신뢰성(Network Reliability)은 최우선 과제가 됩니다. 아무리 가치 있는 마이그레이션이라 하더라도 기존 서비스가 중단된다면 의미가 없기 때문입니다. Uber처럼 대규모 데이터 분석 워크로드와 신규 AI 유스케이스를 지원하기 위해 방대한 데이터를 이전하는 기업의 경우, 네트워크 링크가 과부하(Saturation)되어 핵심 애플리케이션 트래픽의 신뢰성을 위협받을 수 있습니다.

기존의 표준 Cloud Interconnect 방식에서 기업들은 극심한 인프라 수요를 감당하기 위해 단순히 대역폭 오버프로비저닝(Bandwidth Overprovisioning) 전략을 취하곤 했습니다. 하지만 오늘날의 하이브리드 클라우드 환경과 Uber 수준의 대규모 조직에서는 피크 타임 사용량에 맞춰 네트워크 용량을 오버프로비저닝하는 방식이 비용 부담이 크고 신뢰성도 떨어집니다.

최첨단 AI 기술 혁신이 결합되면서 이러한 오버프로비저닝의 한계는 더욱 도드라졌습니다. Uber에는 네트워크 정체를 유발하지 않으면서 대용량 데이터 전송을 처리하고, 비즈니스 핵심 애플리케이션의 성능을 보호할 수 있는 시스템이 반드시 필요했습니다.

Uber는 Traffic Handling, Congestion Response, Latency Management, Cost Efficiency라는 Application Awareness의 4가지 주요 기능을 활용하여 현대 기술 스택에 필요한 네트워크 최적화를 달성할 수 있었습니다.

Uber는 비공개 프리뷰(Private Preview)를 시작으로 피닉스(Phoenix, Arizona) 및 애슈번(Ashburn, Virginia)의 Google Cloud Interconnect 배포 구역에 이 기능을 적용했습니다. Application Awareness on Cloud Interconnect를 통해 Uber는 DSCP Marking과 사전 설정된 Queuing Profile을 기반으로 최종 사용자 애플리케이션 트래픽을 분류하고, 시간 제약이 적은 데이터보다 우선순위를 높게 지정할 수 있었습니다.

아래 표는 Application Awareness on Cloud Interconnect의 4가지 핵심 기능이 기존 방식과 어떻게 다르며, Uber와 같은 조직에 어떻게 더 나은 운영 연속성을 제공하는지 보여줍니다.

구분 Standard Interconnect Solutions Application Awareness on Cloud Interconnect
Traffic Handling 모든 트래픽을 동일하게 처리 (FIFO: 선입선출) 6개의 세부 트래픽 클래스로 트래픽 분류
Congestion Response 트래픽 폭주(Burst) 시 고우선순위 앱 트래픽도 드롭(Drop)될 위험 존재 엄격한 우선순위(Strict Priority) 및 대역폭 공유 정책을 통해 비즈니스 핵심 트래픽 보호
Latency Management 주요 애플리케이션의 지연 시간(Latency) 예측 불가 시간 민감형 워크로드에 대해 예측 가능하고 일관된 저지연(Low-Latency) 제공
Cost Efficiency 피크 타임 감당을 위한 비싼 오버프로비저닝 필요 효율적인 대역폭 활용으로 TCO(총소유비용) 절감

Uber의 핵심 성과 (Key Takeaways)

Cloud Interconnect의 Application Awareness를 도입하여 네트워크상에서 비즈니스 핵심 트래픽의 우선순위를 정할 수 있게 되면서, Uber가 얻은 비즈니스 가치는 즉각적이었습니다. 나아가 Uber는 유사한 하이브리드 클라우드 과제를 겪고 있는 다른 기업들이 벤치마킹할 수 있는 청사진(Blueprint)을 제시했습니다.

  • 비즈니스 연속성(Business Continuity) 보장: Uber는 대규모 트래픽 이벤트 발생 시 어떤 애플리케이션 트래픽을 우선 처리할지 실시간으로 결정할 수 있습니다. 이를 통해 계획되었거나 계획되지 않은 극한의 이벤트 상황에서도 미션 크리티컬 애플리케이션이 상시 정상 가동됩니다. Uber 리더십은 이 기능을 글로벌 운영의 핵심 요소로 평가하고 있습니다.
  • 효율적인 대역폭 활용 (Bandwidth Utilization): 정체를 막기 위해 무작정 대역폭을 오버프로비저닝하는 대신, 실제 예상되는 네트워크 대역폭 수요에 맞춰 기존 Cloud Interconnect 용량을 스마트하게 활용할 수 있게 되었습니다. 결과적으로 네트워크 인프라의 TCO(총소유비용)를 절감했습니다.
  • 마이그레이션 걸림돌 제거 (Unblocked Workload Migration): 네트워크 정체로부터 핵심 애플리케이션을 보호할 수 있게 되면서, Uber는 주요 워크로드를 Google Cloud로 대거 이전할 수 있었고 이 과정에서 운영 오버헤드를 획기적으로 줄였습니다.

“Cloud Interconnect의 Application Awareness는 전략적 워크로드를 Google Cloud로 마이그레이션할 수 있게 해준 결정적인 열쇠였으며, 전 세계적인 피크 수요 속에서도 서비스 신뢰성을 유지하는 데 핵심적인 역할을 하고 있습니다. 트래픽 우선순위를 지능적으로 처리함으로써 높은 우선순위의 서비스를 보호하고 인프라 효율성을 높여 TCO를 낮출 수 있었습니다. 이는 단순히 하나의 기능을 도입한 것이 아니라, 비즈니스에 핵심적인 솔루션을 만들어낸 긴밀한 엔지니어링 파트너십의 결과물입니다.”

Harry Liu, Uber Engineering Director

 

AI 시대 및 그 이후를 위한 네트워크 신뢰성 확보

클라우드 기반 AI 모델, 분산 애플리케이션, 데이터 분석을 도입하는 기업이 늘어남에 따라 이에 수반되는 대규모 데이터 전송을 완벽히 처리하는 것은 이제 비즈니스의 필수 과제가 되었습니다. 하지만 이 과정에서 핵심 애플리케이션의 신뢰성이 타협되어서는 안 됩니다.

Uber는 Cloud Interconnect의 Application Awareness를 통해 단순한 대역폭 오버프로비저닝을 넘어 비즈니스 크리티컬 트래픽을 보호하는 것이 현대적인 하이브리드 및 멀티클라우드 전략을 수립하는 데 있어 핵심적인 단계임을 입증했습니다.

문의하기       베스픽 구독하기      
궁금한 점이 있다면 클릭해주세요.