포지션 상세
함께 일하게 될 AI코어개발팀은 번뜩이는 아이디어로 금융 산업에 필요한 AI 기술을 직접 개발합니다. 사용자의 입장에서 필요한 서비스를 정의하고, 적재적소에 필요한 AI 기술을 개발하여 비대면 금융 생활을 돕고 있습니다.
최신 기술을 유연하게 받아들이고, 자신의 서비스에 열정과 책임감을 가지고 함께 일할 동료를 찾고 있습니다. 끝없는 기술에 대한 호기심을 갖고 계신 분, 기술을 활용해 사용자에게 도움을 주는 데 보람을 느끼는 분을 환영합니다.
• LLM 구조·서빙 워크로드·GPU 특성을 프로파일링해 병목을 찾고, 서비스 요구사항에 맞는 LLM 추론 시스템을 설계·구현
• 추론 성능과 GPU 자원 사용 현황을 모니터링하고, 모델·엔진 변경 전후를 비교하는 회귀 테스트로 문제 조기 발견
• Kubernetes 환경에 추론 시스템을 배포·운영하고, 트래픽 변화에 맞춰 요청과 GPU 자원을 효율적 배분
• 모델 추론 최적화
• vLLM·SGLang 등을 기반으로 추론 서버를 구현하고, 서비스 환경에 맞게 구성·튜닝
• 모델 압축, KV 캐시 최적화, 요청 스케줄링(Request Scheduling), 다중 GPU 분산 추론(Distributed Inference)을 적용해 추론 성능을 높이고 모델 품질 저하 여부 확인
• Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등 새로운 기법을 검토하고, 워크로드에 효과적인 기법을 구현·검증
• 최신 LLM 구조와 추론 과정을 이해하고, 모델과 워크로드 특성에 따라 성능 병목을 찾고 최적화 방향을 정할 수 있는 분
• vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 업무에 사용하고, 내부 코드를 분석·수정해 워크로드에 맞게 튜닝해 본 분
• Python을 능숙하게 사용하고, 추론 엔진의 최적화 기능을 직접 구현·검증할 수 있는 분
• 다음 중 한 분야 이상을 깊이 이해하고, 직접 구현·튜닝해 추론 성능을 개선해 본 분
· 모델 압축 또는 KV 캐시 최적화
· 서빙 시스템 최적화(요청 스케줄링, 다중 GPU 분산 추론 등)
· 고급 추론·서빙 최적화(Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등)
최신 기술을 유연하게 받아들이고, 자신의 서비스에 열정과 책임감을 가지고 함께 일할 동료를 찾고 있습니다. 끝없는 기술에 대한 호기심을 갖고 계신 분, 기술을 활용해 사용자에게 도움을 주는 데 보람을 느끼는 분을 환영합니다.
주요업무
• LLM 추론 서비스 개발 및 운영• LLM 구조·서빙 워크로드·GPU 특성을 프로파일링해 병목을 찾고, 서비스 요구사항에 맞는 LLM 추론 시스템을 설계·구현
• 추론 성능과 GPU 자원 사용 현황을 모니터링하고, 모델·엔진 변경 전후를 비교하는 회귀 테스트로 문제 조기 발견
• Kubernetes 환경에 추론 시스템을 배포·운영하고, 트래픽 변화에 맞춰 요청과 GPU 자원을 효율적 배분
• 모델 추론 최적화
• vLLM·SGLang 등을 기반으로 추론 서버를 구현하고, 서비스 환경에 맞게 구성·튜닝
• 모델 압축, KV 캐시 최적화, 요청 스케줄링(Request Scheduling), 다중 GPU 분산 추론(Distributed Inference)을 적용해 추론 성능을 높이고 모델 품질 저하 여부 확인
• Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등 새로운 기법을 검토하고, 워크로드에 효과적인 기법을 구현·검증
자격요건
• LLM 서빙 또는 추론 최적화 분야에서 2년 이상 실무 경험이 있는 분• 최신 LLM 구조와 추론 과정을 이해하고, 모델과 워크로드 특성에 따라 성능 병목을 찾고 최적화 방향을 정할 수 있는 분
• vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 업무에 사용하고, 내부 코드를 분석·수정해 워크로드에 맞게 튜닝해 본 분
• Python을 능숙하게 사용하고, 추론 엔진의 최적화 기능을 직접 구현·검증할 수 있는 분
• 다음 중 한 분야 이상을 깊이 이해하고, 직접 구현·튜닝해 추론 성능을 개선해 본 분
· 모델 압축 또는 KV 캐시 최적화
· 서빙 시스템 최적화(요청 스케줄링, 다중 GPU 분산 추론 등)
· 고급 추론·서빙 최적화(Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등)



