베슬에이아이(VESSL AI)-GPU Cluster Architect
1/1
베슬에이아이(VESSL AI)서울 서초구경력 4년 이상

GPU Cluster Architect

포지션 상세

AI 인프라 스타트업, VESSL AI

수많은 AI 워크로드가 하나의 플랫폼에서 유기적으로 움직이는 세상을 꿈꿉니다.
우리는 파편화된 글로벌 GPU 인프라를 하나로 연결해, 복잡성은 최소화하고 연구와 제품 혁신에만 몰입할 수 있는 환경을 만들어갑니다.

VESSL AI는 국내외 주요 아카데미아와 현대자동차, 티맵모빌리티, 그리고 범정부 초거대 AI 공통기반·데이터센터(B2G) 사업까지 확장하며 기술력을 검증받았습니다. 2026년 VESSL Cloud 런칭을 기점으로 전 세계 GPU를 연결하는 Infrastructure Interface로 새로운 성장에 진입합니다. CB Insights ‘2025 AI Agent Tech Stack’ 등재와 글로벌 빅테크 파트너십을 발판으로, 글로벌 시장으로의 확장을 본격화하고 있습니다.

가장 난해한 문제를 가장 단순한 실행으로 풀어 전 세계 AI 팀의 혁신 속도를 높이는 것,
이러한 우리의 비전에 공감하고 미래를 만들어갈 동료를 적극적으로 찾고 있어요. 빠르게 성장하는 AI인프라 시장에서 의미있는 도전에 함께 하세요!
>> VESSL Cloud 더 알아보기 :
https://blog.vessl.ai/ko/posts/vesslcloud-kr

<About the Role>
VESSL AI GPU Cluster Architect는 CSP/데이터센터 파트너와 전력, 냉각, 네트워크 등 기술적 조건에 대한 협상을 직접 진행하며, 신규 사이트의 Qualification, 클러스터 아키텍처 설계, 하드웨어 구매, 그리고 완성된 클러스터의 검증까지 인프라가 플랫폼에 최적의 구성으로 전달되는 전 과정을 기술적으로 책임집니다.

이 과정은 단순한 페이퍼 기반의 스펙 검토로 끝나지 않습니다. 설비의 도면과 장비 사양을 직접 들여다보고, 건설 중이거나 운영 중인 데이터센터 현장을 방문해 CSP·시공사·벤더와 대면하여 협의하는 일들이 이 역할의 핵심입니다.
대규모 GPU 클러스터/데이터센터의 구축에서 의사 결정 과정은 클러스터 아키텍처와 시스템 레벨의 기술적 이해가 필수적입니다.
협업할 CSP/데이터센터를 기술적으로 검증하고, 인프라가 어떤 스펙으로 구축·검증될지에 대한 기술 기준을 수립함으로서 GPU 공급망의 기술적 품질과 안정성을 담보하는 핵심 역할을 해나갑니다.



VESSL AI는 전 세계 여러 CSP와 데이터센터 파트너의 GPU 자원을 하나의 플랫폼으로 연결해 고객에게 제공합니다.
이를 위해서는 우선 플랫폼이 구축될 데이터센터 캠퍼스가 대규모 GPU Workload를 실제로 감당할 수 있는 부분일지, 계약 전력과 수전 방식, 냉각 용량, 랙당 전력 밀도 등 여러 방면에서 기술적으로 검증하는 일이 필수적입니다.

또한 구축할 클러스터의 Network Topology를 설계하고, 실제 구축이 완료된 클러스터가 설계 스펙대로 동작하는지 Slurm, Kubernetes 기반 스케줄링 환경에서 직접 검증하는 과정을 수행합니다.
이 모든 과정은 하드웨어 구매 단계의 의사결정부터 CSP, 벤더사, 현지 운영사(OpCo), 내부 Sales 조직의 다양한 이해관계자 간 기술적 이견 조율을 요구하는 고도의 기술 역량이 필요합니다.

주요업무

• DC/CSP Qualification: 신규·기존 데이터센터가 대규모 GPU 클러스터를 수용할 수 있는지 계약 전력, 수전 방식, 냉각 용량(공랭/액랭, PUE), 랙당 전력 밀도 등을 도면과 장비 사양 레벨에서 직접 검토하고 Go/No-go 판단 기준을 수립
• Cluster Architecture Design: IP Plan, Network Topology(Rail-optimized, Fat-tree 등), InfiniBand/RoCEv2 기반 High-speed Network 구성을 설계
• Cluster Validation: 구축 완료된 클러스터를 Slurm, Kubernetes 등 스케줄링 환경 위에서 벤치마크·Burn-in 테스트로 검증하고, 하드웨어·OS·드라이버·네트워크 전 레이어에 걸친 성능·안정성 이슈를 직접 진단
• Hardware Procurement: GPU 서버, 스위치, 케이블링 등 하드웨어 스펙을 정의하고 벤더/OEM/ODM과 구매·납품 일정을 조율
• 기술 협상 및 Stakeholder 조율: CSP, 데이터센터, 네트워크/전력 벤더, 내부 Infra·Sales 팀 등 다양한 이해관계자와의 기술 협상을 리드

자격요건

• 전기전자, 컴퓨터공학 등 관련 전공 학사 이상 학위 보유
• GPU/HPC 클러스터 설계 또는 구축·운영 경력 4년 이상 보유
• 데이터센터 현장 방문·출장이 가능하며, 현장에서 CSP·운영사(OpCo)·벤더와 직접 대면 협의하는 데 익숙하신 분
• InfiniBand, RoCEv2 등 High-speed Fabric 및 Network Topology 설계 경험
• 데이터센터 구축/운영 관련 실무 경험 중 아래 2개 이상 충족하신 분
• Slurm, Kubernetes 등 스케줄러/오케스트레이션 환경에서 클러스터를 검증·운영해 보신 경험
• 데이터센터의 전력(수전, UPS, PDU), 냉각(공랭/수랭) 등 Facility 요구사항을 이해하고 CSP/데이터센터와 직접 기술 협의를 해보신 경험
• 수배전·변압기, UPS/PDU, CDU·냉각배관, 배전반 등 DC MEP(전력·냉각·기계) 설비에 대한 실무적 이해 및 엔지니어링 현장 경험
• GPU, NIC, PCIe 등 서버·GPU 하드웨어 전반과 OS/드라이버 레벨까지 아우르는 Full-stack 트러블슈팅 능력
• NVIDIA Scalable Unit 기준 4SU (Blackwell 2,048장) 규모 이상 단일 GPU 클러스터를 설계·구축·운영해 보신 경험

기술 스택 • 툴

태그

마감일

상시채용

근무지역

서울 강남구 테헤란로5길 7, 13층
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>