모레-LLM Inference Engineer
모레-LLM Inference Engineer
모레-LLM Inference Engineer
모레-LLM Inference Engineer
모레-LLM Inference Engineer
1/5
모레서울 서초구경력 1년 이상

LLM Inference Engineer

포지션 상세

• Moreh는 대규모 GPU/NPU 클러스터에서 다양한 LLM을 서빙하는 “토큰 팩토리” 데이터센터를 효율적으로 구동하기 위한 추론 소프트웨어를 개발, 제공합니다.
• LLM Inference Engineer는 이종 GPU 클러스터에서 LLM 추론을 고성능으로 실행할 수 있도록 다양한 분산 추론 기술을 개발, 통합, 배포하는 업무를 담당합니다.

주요업무

• 다수의 ​노드와 이기종 가속기를 활용해, LLM 추론 워크로드를 효율적으로 실행할 수 있는 실행 환경 구축
• LLM 서빙 프레임워크(vLLM, SGLang 등)의 성능 최적화
• 스토리지, 메모리, GPU 간 고속 통신을 위한 low-level 라이브러리(NCCL, NIXL, UCX 등)의 활용 및 최적화
• 효율적인 KV cache 오프로딩 및 티어링
• GPU를 효율적으로 활용하기 위한 라우팅 규칙 개발, 적용
• 하드웨어 특성과 서비스 요구를 모두 고려한 병목 분석 및 시스템 성능 개선

자격요건

• 컴퓨터공학 혹은 관련 전공 학부 졸업, 혹은 이와 동등한 경력이 있으신 분
• 시스템 소프트웨어 개발 혹은 활용 경험이 있으신 분
• LLM 추론 과정에 대한 기본적인 이해가 있으신 분
• 팀워크를 중시하고, 긍정적인 태도로 동료들과 적극적으로 협력할 수 있으신 분

기술 스택 • 툴

태그

마감일

2026.09.30

근무지역

서울시 서초구 서초대로 396, 강남빌딩 20층
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>

더 많은 포지션을 찾아 볼까요?

지원할 만한 매력적인 포지션들이 기다리고 있어요.