카카오뱅크(kakaobank)-LLM 서빙 및 추론 최적화 엔지니어
카카오뱅크(kakaobank)-LLM 서빙 및 추론 최적화 엔지니어
카카오뱅크(kakaobank)-LLM 서빙 및 추론 최적화 엔지니어
1/3
카카오뱅크(kakaobank)경기 성남시경력 2년 이상

LLM 서빙 및 추론 최적화 엔지니어

포지션 상세

함께 일하게 될 AI코어개발팀은 번뜩이는 아이디어로 금융 산업에 필요한 AI 기술을 직접 개발합니다. 사용자의 입장에서 필요한 서비스를 정의하고, 적재적소에 필요한 AI 기술을 개발하여 비대면 금융 생활을 돕고 있습니다.

최신 기술을 유연하게 받아들이고, 자신의 서비스에 열정과 책임감을 가지고 함께 일할 동료를 찾고 있습니다. 끝없는 기술에 대한 호기심을 갖고 계신 분, 기술을 활용해 사용자에게 도움을 주는 데 보람을 느끼는 분을 환영합니다.

주요업무

• LLM 추론 서비스 개발 및 운영
• LLM 구조·서빙 워크로드·GPU 특성을 프로파일링해 병목을 찾고, 서비스 요구사항에 맞는 LLM 추론 시스템을 설계·구현
• 추론 성능과 GPU 자원 사용 현황을 모니터링하고, 모델·엔진 변경 전후를 비교하는 회귀 테스트로 문제 조기 발견
• Kubernetes 환경에 추론 시스템을 배포·운영하고, 트래픽 변화에 맞춰 요청과 GPU 자원을 효율적 배분

• 모델 추론 최적화
• vLLM·SGLang 등을 기반으로 추론 서버를 구현하고, 서비스 환경에 맞게 구성·튜닝
• 모델 압축, KV 캐시 최적화, 요청 스케줄링(Request Scheduling), 다중 GPU 분산 추론(Distributed Inference)을 적용해 추론 성능을 높이고 모델 품질 저하 여부 확인
• Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등 새로운 기법을 검토하고, 워크로드에 효과적인 기법을 구현·검증

자격요건

• LLM 서빙 또는 추론 최적화 분야에서 2년 이상 실무 경험이 있는 분
• 최신 LLM 구조와 추론 과정을 이해하고, 모델과 워크로드 특성에 따라 성능 병목을 찾고 최적화 방향을 정할 수 있는 분
• vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 업무에 사용하고, 내부 코드를 분석·수정해 워크로드에 맞게 튜닝해 본 분
• Python을 능숙하게 사용하고, 추론 엔진의 최적화 기능을 직접 구현·검증할 수 있는 분
• 다음 중 한 분야 이상을 깊이 이해하고, 직접 구현·튜닝해 추론 성능을 개선해 본 분
· 모델 압축 또는 KV 캐시 최적화
· 서빙 시스템 최적화(요청 스케줄링, 다중 GPU 분산 추론 등)
· 고급 추론·서빙 최적화(Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등)

기술 스택 • 툴

태그

마감일

2026.08.31

근무지역

경기 성남시 분당구 분당내곡로 131, 판교테크원타워 타워2 15층
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>

더 많은 포지션을 찾아 볼까요?

지원할 만한 매력적인 포지션들이 기다리고 있어요.