포지션 상세
AI 인프라 스타트업, VESSL AI
수많은 AI 워크로드가 하나의 플랫폼에서 유기적으로 움직이는 세상을 꿈꿉니다.
우리는 파편화된 글로벌 GPU 인프라를 하나로 연결해, 복잡성은 최소화하고 연구와 제품 혁신에만 몰입할 수 있는 환경을 만들어갑니다.
VESSL AI는 국내외 주요 아카데미아와 현대자동차, 티맵모빌리티, 그리고 범정부 초거대 AI 공통기반·데이터센터(B2G) 사업까지 확장하며 기술력을 검증받았습니다. 2026년 VESSL Cloud 런칭을 기점으로 전 세계 GPU를 연결하는 Infrastructure Interface로 새로운 성장에 진입합니다. CB Insights ‘2025 AI Agent Tech Stack’ 등재와 글로벌 빅테크 파트너십을 발판으로, 글로벌 시장으로의 확장을 본격화하고 있습니다.
가장 난해한 문제를 가장 단순한 실행으로 풀어 전 세계 AI 팀의 혁신 속도를 높이는 것,
이러한 우리의 비전에 공감하고 미래를 만들어갈 동료를 적극적으로 찾고 있어요. 빠르게 성장하는 AI인프라 시장에서 의미있는 도전에 함께 하세요!
>> VESSL Cloud 더 알아보기 : https://blog.vessl.ai/ko/posts/vesslcloud-kr
<About the Role>
VESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다.
Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.
그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다.
GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다.
이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.
• Incident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결
• Architecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도
• Automation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영
• Proactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도
• Capacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드
• 팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링
• 5년 이상의 Software/Site Reliability Engineering 경험
• GPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험
• Linux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험
• Python, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험
• Kubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험
• 대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험
• 여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험
• On-call 로테이션에 참여 가능하신 분
수많은 AI 워크로드가 하나의 플랫폼에서 유기적으로 움직이는 세상을 꿈꿉니다.
우리는 파편화된 글로벌 GPU 인프라를 하나로 연결해, 복잡성은 최소화하고 연구와 제품 혁신에만 몰입할 수 있는 환경을 만들어갑니다.
VESSL AI는 국내외 주요 아카데미아와 현대자동차, 티맵모빌리티, 그리고 범정부 초거대 AI 공통기반·데이터센터(B2G) 사업까지 확장하며 기술력을 검증받았습니다. 2026년 VESSL Cloud 런칭을 기점으로 전 세계 GPU를 연결하는 Infrastructure Interface로 새로운 성장에 진입합니다. CB Insights ‘2025 AI Agent Tech Stack’ 등재와 글로벌 빅테크 파트너십을 발판으로, 글로벌 시장으로의 확장을 본격화하고 있습니다.
가장 난해한 문제를 가장 단순한 실행으로 풀어 전 세계 AI 팀의 혁신 속도를 높이는 것,
이러한 우리의 비전에 공감하고 미래를 만들어갈 동료를 적극적으로 찾고 있어요. 빠르게 성장하는 AI인프라 시장에서 의미있는 도전에 함께 하세요!
>> VESSL Cloud 더 알아보기 : https://blog.vessl.ai/ko/posts/vesslcloud-kr
<About the Role>
VESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다.
Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.
그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다.
GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다.
이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.
주요업무
• Reliability & Observability: 메트릭·로그·트레이스 등 Observability 스택을 구축하고, SLI/SLO를 정의해 플랫폼의 안정성을 정량적으로 추적• Incident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결
• Architecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도
• Automation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영
• Proactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도
• Capacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드
• 팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링
자격요건
• 컴퓨터공학, 전자공학, AI 등 관련 전공 학사 이상 학위 혹은 이에 준하는 실무 경험• 5년 이상의 Software/Site Reliability Engineering 경험
• GPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험
• Linux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험
• Python, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험
• Kubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험
• 대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험
• 여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험
• On-call 로테이션에 참여 가능하신 분

