포지션 상세
서브원 서비스는 국내는 물론 해외의 다양한 기업 고객들이 방문해 수백만 종 이상의 상품을 구매하고 있는 B2B 전문 커머스 서비스입니다.
우리 CTO 조직은 고객향 메인홈부터 물류를 포함한 여러 백엔드 서비스까지 서비스 전체의 정책을 수립하고 사내외 여러 부서와 소통하는 역할을 합니다.
우리 서비스의 다양한 요소들을 이해하고 서비스가 빠르게 성장할 수 있도록 필요한 기능과 프로세스를 기획하고 구축합니다.
또한 회사 전체가 더 나은 생산성을 가지도록 업무와 프로세스를 개선하는 역할도 수행합니다.
• 장애를 비난이 아닌 시스템 개선의 입력으로 보고, 같은 장애가 반복되지 않게 만드는 분
• "서버는 정상인데 서비스가 느린" 상황에서 원인 구간을 끝까지 추적하는 분
• 같은 작업을 두 번 하면 세 번째는 자동화하는 분
[담당 업무]
• AWS와 온프레미스 환경을 기반으로 한 하이브리드 인프라의 안정적 운영 담당
• 서비스 장애 관리 — 감지·초동 대응부터 원인 분석(RCA), 재발 방지 대책 수립·이행까지 장애 라이프사이클 전반 수행
• 성능 이슈 관리 — APM·로그·DB 지표 기반으로 병목(슬로우 쿼리, 커넥션, 리소스)을 분석하고, 개발 조직과 협업하여 개선
• 신규 시스템 오픈 지원 — 오픈 전 성능·가용성·백업복구 검증, 오픈 후 안정화 모니터링 수행
• 자체 구축한 통합 관제 플랫폼(AIOps) 기반의 모니터링 운영·고도화 및 반복 운영 업무의 자동화
• 클라우드 비용/보안/가용성 개선 등 운영 품질 향상 활동
• 대규모 트래픽 서비스의 장애 대응 및 원인 분석(RCA)을 다수 수행하고, 재발 방지까지 이끌어 본 분
• APM·로그·모니터링 지표를 기반으로 성능 병목을 직접 분석·조치해 본 분
• 대규모 서비스 오픈/전환 프로젝트에서 인프라 검증과 오픈 후 안정화를 경험하신 분
• 멀티계정(Landing Zone/Organizations), IAM·SCP·네트워크 정책에 대한 높은 이해도를 갖추신 분
• VPC/서브넷/라우팅, TGW, Direct Connect 등 하이브리드 네트워크 운영 경험 보유자
• Terraform 또는 CloudFormation 기반의 IaC 자동화 경험과, Python/Bash 기반 운영 자동화 도구 제작 경험이 있는 분
• 장애 상황에서 협업 조직(보안/개발/운영)과 원인 구간을 명확히 소통·조율할 수 있으며, 문서 기반의 업무 역량을 갖춘 분
• 복잡한 인프라 환경에서 문제를 구조화하고 개선안을 주도적으로 제시할 수 있는 분
우리 CTO 조직은 고객향 메인홈부터 물류를 포함한 여러 백엔드 서비스까지 서비스 전체의 정책을 수립하고 사내외 여러 부서와 소통하는 역할을 합니다.
우리 서비스의 다양한 요소들을 이해하고 서비스가 빠르게 성장할 수 있도록 필요한 기능과 프로세스를 기획하고 구축합니다.
또한 회사 전체가 더 나은 생산성을 가지도록 업무와 프로세스를 개선하는 역할도 수행합니다.
주요업무
[이런 분과 함께하고 싶습니다]• 장애를 비난이 아닌 시스템 개선의 입력으로 보고, 같은 장애가 반복되지 않게 만드는 분
• "서버는 정상인데 서비스가 느린" 상황에서 원인 구간을 끝까지 추적하는 분
• 같은 작업을 두 번 하면 세 번째는 자동화하는 분
[담당 업무]
• AWS와 온프레미스 환경을 기반으로 한 하이브리드 인프라의 안정적 운영 담당
• 서비스 장애 관리 — 감지·초동 대응부터 원인 분석(RCA), 재발 방지 대책 수립·이행까지 장애 라이프사이클 전반 수행
• 성능 이슈 관리 — APM·로그·DB 지표 기반으로 병목(슬로우 쿼리, 커넥션, 리소스)을 분석하고, 개발 조직과 협업하여 개선
• 신규 시스템 오픈 지원 — 오픈 전 성능·가용성·백업복구 검증, 오픈 후 안정화 모니터링 수행
• 자체 구축한 통합 관제 플랫폼(AIOps) 기반의 모니터링 운영·고도화 및 반복 운영 업무의 자동화
• 클라우드 비용/보안/가용성 개선 등 운영 품질 향상 활동
자격요건
• AWS 인프라 운영 경력 7년 이상의 미드~시니어급 엔지니어• 대규모 트래픽 서비스의 장애 대응 및 원인 분석(RCA)을 다수 수행하고, 재발 방지까지 이끌어 본 분
• APM·로그·모니터링 지표를 기반으로 성능 병목을 직접 분석·조치해 본 분
• 대규모 서비스 오픈/전환 프로젝트에서 인프라 검증과 오픈 후 안정화를 경험하신 분
• 멀티계정(Landing Zone/Organizations), IAM·SCP·네트워크 정책에 대한 높은 이해도를 갖추신 분
• VPC/서브넷/라우팅, TGW, Direct Connect 등 하이브리드 네트워크 운영 경험 보유자
• Terraform 또는 CloudFormation 기반의 IaC 자동화 경험과, Python/Bash 기반 운영 자동화 도구 제작 경험이 있는 분
• 장애 상황에서 협업 조직(보안/개발/운영)과 원인 구간을 명확히 소통·조율할 수 있으며, 문서 기반의 업무 역량을 갖춘 분
• 복잡한 인프라 환경에서 문제를 구조화하고 개선안을 주도적으로 제시할 수 있는 분


