포지션 상세
[합류하게 될 팀에 대해 알려드려요]
• 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요.
• SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요.
• Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요.
• Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요.
• 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요.
• 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요.
• 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요.
• Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요.
• 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요.
• 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요.
• SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요.
• 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요.
• 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요.
• 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요.
• 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요.
• 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요.
• AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요.
• 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요.
• 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요.
• SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요.
• Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요.
• Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요.
• 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요.
주요업무
[합류하면 함께할 업무예요]• 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요.
• 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요.
• Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요.
• 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요.
• 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요.
• SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요.
• 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요.
자격요건
[이런 분과 함께하고 싶어요]• 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요.
• 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요.
• 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요.
• 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요.
• AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요.
• 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요.


