포지션 상세
[합류하게 될 팀에 대해 알려드려요]
• 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 제품과 서비스가 성장하는 과정에서도 안정적인 결제 경험과 매장 운영을 제공할 수 있도록 신뢰성과 확장성을 중요한 가치로 생각해요.
• Server Platform Team은 제품들이 빠르고 안정적으로 개발·배포·운영될 수 있는 공통 기술 기반을 만들어요. DevOps Engineer는 AWS, Kubernetes와 Istio를 기반으로 Cloud Native 플랫폼을 설계하고 운영해요.
• 서비스와 트래픽의 성장을 안정적으로 수용하려면 플랫폼의 용량과 변경 위험을 예측 가능하게 관리하고, 반복되는 운영 업무를 도구와 자동화로 전환해야 해요. 장애가 발생했을 때 시스템 상태를 빠르게 파악하고 복구할 수 있는 기반도 함께 만들어가고 있어요.
• DevOps Engineer는 현재 플랫폼의 구조와 운영 방식을 진단하고, Cloud, Kubernetes, Service Mesh, 배포 플랫폼, IaC와 Observability 기반을 아우르는 주요 기술적 의사결정을 주도해요. 제품과 조직의 성장 계획을 바탕으로 DevOps 전략과 중장기 로드맵을 수립하고 실행해요.
• Server Developer, DBA와 각 제품팀의 개발자들을 비롯해 SRE 역할과 긴밀하게 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 사용자 관점의 공통 신뢰성 기준을 발전시켜요. DevOps는 이를 안정적으로 달성할 수 있는 플랫폼과 배포·운영 기반을 만들어요.
• 토스플레이스의 제품과 조직 성장 계획을 바탕으로 DevOps 전략과 Cloud Native 플랫폼의 중장기 로드맵을 수립해요. 현재 플랫폼의 리스크와 한계를 진단하고 주요 과제의 목표와 우선순위 및 성공 기준을 정해 실행해요.
• AWS 환경의 여러 Kubernetes 클러스터와 Istio 기반 Service Mesh의 목표 아키텍처를 설계해요. Capacity Planning과 성능 검증을 바탕으로 확장성, SPOF, 장애 격리, 변경 안전성, 리소스와 비용 효율을 지속적으로 개선해요.
• 빌드부터 배포·검증·롤백까지의 과정을 표준화하고 CI/CD와 GitOps 기반의 배포 플랫폼을 고도화해요. IaC와 Policy as Code를 이용해 인프라 변경을 재현 가능하게 관리하고, 보안과 컴플라이언스 요구사항을 플랫폼의 기본 안전장치로 구현해요.
• 개발자의 반복적인 인프라 작업과 운영 과정의 불편을 발견하고, 이를 안전하게 직접 처리할 수 있는 Self-service 도구와 플랫폼으로 해결해요. 실제 사용 범위와 작업 시간 및 반복 작업량의 변화를 통해 개선 효과를 확인해요.
• Metric과 Log를 포함한 관측 데이터를 안정적으로 수집·저장·조회할 수 있는 Observability 기반을 운영해요. SRE와 제품팀이 정의한 신뢰성 기준을 측정하고 활용할 수 있도록 필요한 플랫폼 기능과 도구를 제공해요.
• 인프라와 플랫폼 영역의 장애 대응과 복구를 주도하고, 서비스 장애에서는 SRE 및 제품팀과 함께 원인을 분석해 복구를 지원해요. 주요 장애 시나리오의 Runbook과 복구 도구를 마련하고 반복되는 진단과 복구 작업을 자동화해요.
• 주요 설계와 기술적 의사결정을 문서화하고, 설계 리뷰와 경험 공유를 통해 동료의 성장을 도와요. 여러 사람이 일관된 기준으로 플랫폼을 설계하고 운영할 수 있도록 팀의 기술 기준과 업무 방식을 발전시켜요.
• DevOps 또는 Platform Engineering 영역에서 현재 시스템과 조직의 문제를 진단하고, 목표와 로드맵을 수립해 주요 과제를 실행까지 주도해본 분을 찾아요.
• Public Cloud 환경에서 Kubernetes 기반 프로덕션 플랫폼을 설계·운영하고, 아키텍처, 확장, 업그레이드, 장애 격리와 변경 안전성에 관한 주요 기술적 의사결정을 내려본 경험이 필요해요.
• IaC를 이용해 프로덕션 인프라를 재현 가능하게 관리하고, 여러 서비스와 팀이 사용하는 CI/CD, GitOps 또는 인프라 자동화 시스템을 구축해 실제 도입과 운영 방식의 변화까지 만들어본 분과 함께하고 싶어요.
• 하나 이상의 프로그래밍 언어로 플랫폼 기능, 진단·복구 도구와 운영 자동화를 개발하고, 테스트와 리뷰를 포함한 소프트웨어 엔지니어링 방식으로 관리할 수 있는 분을 찾아요.
• 애플리케이션, Container, OS, Network 등 여러 계층에 걸친 장애의 원인 분석과 복구를 주도하고, 자동화와 아키텍처 개선을 통해 재발을 방지해본 분을 찾아요.
• 안정성, 성능, 보안, 비용과 운영 복잡도 사이의 트레이드오프를 바탕으로 기술 방향을 결정하고, 여러 팀의 합의를 만들어 실제 업무 방식으로 정착시켜본 분과 함께하고 싶어요.
• 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 제품과 서비스가 성장하는 과정에서도 안정적인 결제 경험과 매장 운영을 제공할 수 있도록 신뢰성과 확장성을 중요한 가치로 생각해요.
• Server Platform Team은 제품들이 빠르고 안정적으로 개발·배포·운영될 수 있는 공통 기술 기반을 만들어요. DevOps Engineer는 AWS, Kubernetes와 Istio를 기반으로 Cloud Native 플랫폼을 설계하고 운영해요.
• 서비스와 트래픽의 성장을 안정적으로 수용하려면 플랫폼의 용량과 변경 위험을 예측 가능하게 관리하고, 반복되는 운영 업무를 도구와 자동화로 전환해야 해요. 장애가 발생했을 때 시스템 상태를 빠르게 파악하고 복구할 수 있는 기반도 함께 만들어가고 있어요.
• DevOps Engineer는 현재 플랫폼의 구조와 운영 방식을 진단하고, Cloud, Kubernetes, Service Mesh, 배포 플랫폼, IaC와 Observability 기반을 아우르는 주요 기술적 의사결정을 주도해요. 제품과 조직의 성장 계획을 바탕으로 DevOps 전략과 중장기 로드맵을 수립하고 실행해요.
• Server Developer, DBA와 각 제품팀의 개발자들을 비롯해 SRE 역할과 긴밀하게 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 사용자 관점의 공통 신뢰성 기준을 발전시켜요. DevOps는 이를 안정적으로 달성할 수 있는 플랫폼과 배포·운영 기반을 만들어요.
주요업무
[합류하면 함께 할 업무예요]• 토스플레이스의 제품과 조직 성장 계획을 바탕으로 DevOps 전략과 Cloud Native 플랫폼의 중장기 로드맵을 수립해요. 현재 플랫폼의 리스크와 한계를 진단하고 주요 과제의 목표와 우선순위 및 성공 기준을 정해 실행해요.
• AWS 환경의 여러 Kubernetes 클러스터와 Istio 기반 Service Mesh의 목표 아키텍처를 설계해요. Capacity Planning과 성능 검증을 바탕으로 확장성, SPOF, 장애 격리, 변경 안전성, 리소스와 비용 효율을 지속적으로 개선해요.
• 빌드부터 배포·검증·롤백까지의 과정을 표준화하고 CI/CD와 GitOps 기반의 배포 플랫폼을 고도화해요. IaC와 Policy as Code를 이용해 인프라 변경을 재현 가능하게 관리하고, 보안과 컴플라이언스 요구사항을 플랫폼의 기본 안전장치로 구현해요.
• 개발자의 반복적인 인프라 작업과 운영 과정의 불편을 발견하고, 이를 안전하게 직접 처리할 수 있는 Self-service 도구와 플랫폼으로 해결해요. 실제 사용 범위와 작업 시간 및 반복 작업량의 변화를 통해 개선 효과를 확인해요.
• Metric과 Log를 포함한 관측 데이터를 안정적으로 수집·저장·조회할 수 있는 Observability 기반을 운영해요. SRE와 제품팀이 정의한 신뢰성 기준을 측정하고 활용할 수 있도록 필요한 플랫폼 기능과 도구를 제공해요.
• 인프라와 플랫폼 영역의 장애 대응과 복구를 주도하고, 서비스 장애에서는 SRE 및 제품팀과 함께 원인을 분석해 복구를 지원해요. 주요 장애 시나리오의 Runbook과 복구 도구를 마련하고 반복되는 진단과 복구 작업을 자동화해요.
• 주요 설계와 기술적 의사결정을 문서화하고, 설계 리뷰와 경험 공유를 통해 동료의 성장을 도와요. 여러 사람이 일관된 기준으로 플랫폼을 설계하고 운영할 수 있도록 팀의 기술 기준과 업무 방식을 발전시켜요.
자격요건
[이런 분과 함께하고 싶어요]• DevOps 또는 Platform Engineering 영역에서 현재 시스템과 조직의 문제를 진단하고, 목표와 로드맵을 수립해 주요 과제를 실행까지 주도해본 분을 찾아요.
• Public Cloud 환경에서 Kubernetes 기반 프로덕션 플랫폼을 설계·운영하고, 아키텍처, 확장, 업그레이드, 장애 격리와 변경 안전성에 관한 주요 기술적 의사결정을 내려본 경험이 필요해요.
• IaC를 이용해 프로덕션 인프라를 재현 가능하게 관리하고, 여러 서비스와 팀이 사용하는 CI/CD, GitOps 또는 인프라 자동화 시스템을 구축해 실제 도입과 운영 방식의 변화까지 만들어본 분과 함께하고 싶어요.
• 하나 이상의 프로그래밍 언어로 플랫폼 기능, 진단·복구 도구와 운영 자동화를 개발하고, 테스트와 리뷰를 포함한 소프트웨어 엔지니어링 방식으로 관리할 수 있는 분을 찾아요.
• 애플리케이션, Container, OS, Network 등 여러 계층에 걸친 장애의 원인 분석과 복구를 주도하고, 자동화와 아키텍처 개선을 통해 재발을 방지해본 분을 찾아요.
• 안정성, 성능, 보안, 비용과 운영 복잡도 사이의 트레이드오프를 바탕으로 기술 방향을 결정하고, 여러 팀의 합의를 만들어 실제 업무 방식으로 정착시켜본 분과 함께하고 싶어요.


