베슬에이아이(VESSL AI)-Technical Program Manager
1/1
베슬에이아이(VESSL AI)서울 서초구경력 6년 이상

Technical Program Manager

포지션 상세

AI 인프라 스타트업, VESSL AI

수많은 AI 워크로드가 하나의 플랫폼에서 유기적으로 움직이는 세상을 꿈꿉니다.
우리는 파편화된 글로벌 GPU 인프라를 하나로 연결해, 복잡성은 최소화하고 연구와 제품 혁신에만 몰입할 수 있는 환경을 만들어갑니다.

VESSL AI는 국내외 주요 아카데미아와 현대자동차, 티맵모빌리티, 그리고 범정부 초거대 AI 공통기반·데이터센터(B2G) 사업까지 확장하며 기술력을 검증받았습니다. 2026년 VESSL Cloud 런칭을 기점으로 전 세계 GPU를 연결하는 Infrastructure Interface로 새로운 성장에 진입합니다. CB Insights ‘2025 AI Agent Tech Stack’ 등재와 글로벌 빅테크 파트너십을 발판으로, 글로벌 시장으로의 확장을 본격화하고 있습니다.

가장 난해한 문제를 가장 단순한 실행으로 풀어 전 세계 AI 팀의 혁신 속도를 높이는 것,
이러한 우리의 비전에 공감하고 미래를 만들어갈 동료를 적극적으로 찾고 있어요. 빠르게 성장하는 AI인프라 시장에서 의미있는 도전에 함께 하세요!
>> VESSL Cloud 더 알아보기 :
https://blog.vessl.ai/ko/posts/vesslcloud-kr

<About the Role>
VESSL AI의 Technical Program Manager는 Product Division 소속으로 Capacity & Infra Team에서 Supply 조직의 신규 용량 확보·온보딩 일정과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 실행 계획으로 전환합니다.
SRE가 정의한 SLI/SLO 데이터를 근거로 고객에게 제시 가능한 Demand-side SLA 수준을 설계하고,
SRE·Product·Sales Leadership 간의 협의를 주도해 최종 합의를 이끌어냅니다.
정기 Capacity Review를 운영하며 배분 현황과 리스크를 관련 조직과 공유합니다.
또한 팀 내 SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트를 이끌며, VESSL AI 플랫폼 전반의 안정적 운영을 책임집니다.

GPU는 유한하고 값비싼 자원입니다.
하나의 클러스터는 온디맨드·예약형(RI) 등 여러 판매 방식으로, 그리고 Training부터 Inference까지 다양한 워크로드 형태로 동시에 여러 고객에게 활용됩니다.
이 자원을 실제로 확보하는 조직(신규 클러스터 조달·구축을 담당하는 Supply 조직), 이를 운영하고 실제 가용 용량을 책임지는 조직(SRE/Infra), 그리고 이를 판매하고 고객에게 커밋하는 조직(Sales/CS) 간에는 지속적인 정보 동기화와 우선순위 정렬이 필요합니다.
Capacity Plan 수립, 배분 현황 추적, 공급 지연이나 수요 급증에 따른 리스크 관리를 위해서는 이 세 조직으로부터 데이터를 취합하고 의사결정을 조율해나갑니다.

주요업무

• Capacity Plan 통합: Supply 조직의 신규 용량 확보 계획과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 지속적으로 업데이트
• 신규 Supply 온보딩 조율: Supply 조직이 확보한 신규 클러스터가 검증, 네트워크·스케줄러 연동을 거쳐 플랫폼에서 실제로 판매 가능한 상태가 되기까지의 일정을 SRE/Infra와 조율하고 추적
• Demand-side SLA 설계 및 협의 주도: SRE의 SLI/SLO 데이터를 기반으로 고객에게 제시 가능한 SLA 수준을 설계하고, SRE·Product·Sales Leadership과의 협의를 주도해 최종 합의를 이끌어냄
• Capacity Allocation Governance: 온디맨드·예약형(RI)·스팟 등 판매 유형별 용량 배분 정책을 수립하고, 실제 배분 현황을 추적·리포팅
• Infra Program 리딩: SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트 우선순위를 정하고 실행을 조율
• Program Cadence & Reporting: Capacity Review 등 정기 운영 회의체를 설계·운영하고, 팀 내 SWE와 함께 공급-수요 가시화 도구를 기획·구축하며, 경영진 및 유관 조직을 위한 대시보드·리포팅 체계를 구축
• Risk & Escalation: 공급 지연, 온보딩 지연, 수요 급증, 인프라 장애 등으로 인한 리스크를 조기에 포착해 관련 조직에 에스컬레이션하고 완화 계획을 함께 수립

자격요건

• 컴퓨터공학, 산업공학 등 관련 전공 학사 이상 학위 보유
• TPM/Product Manager/Project Manager로서 6년 이상의 경험
• 클라우드/데이터센터/GPU 인프라의 기술적 구조(컴퓨팅, 네트워크, 스토리지)에 대한 기본적 이해
• SLI/SLO 데이터를 근거로 대고객 SLA를 설계하고, 여러 조직 간 합의를 이끌어낸 경험
• SRE, SWE, Security Engineer 등 엔지니어 직군과 직접 협업하며 기술적 우선순위를 조율해 본 경험
• 엔지니어링, 세일즈, 경영진 등 서로 다른 배경의 이해관계자 간 데이터를 취합해 의사결정을 이끌어낸 경험
• 복잡한 프로그램의 리스크와 디펜던시를 구조화하고 관리해 본 경험
• SQL 등을 활용해 데이터를 분석하고 대시보드를 구축할 수 있는 분
• 비즈니스 레벨의 영어 커뮤니케이션 역량 보유

기술 스택 • 툴

태그

마감일

상시채용

근무지역

서울 강남구 테헤란로5길 7, 13층
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>