포지션 상세
AI Evaluation Engineer는 LLM의 성능을 평가하고 실패 원인을 분석해, 다음 단계의 학습 데이터와 평가 체계를 설계하는 역할입니다.
모델의 역량 목표와 실제 비즈니스 시나리오를 바탕으로 평가 과제, 데이터 기준 및 채점 방식을 설계합니다. 모델 출력과 Agent 행동 궤적을 분석해 구체적인 역량 부족을 파악하고, 이를 학습 데이터와 평가 데이터의 개선으로 연결합니다. 평가와 데이터 개선이 실제 모델 성능 향상으로 이어졌는지도 실험을 통해 검증합니다.
이 포지션의 핵심은 강화학습 알고리즘 개발 자체보다 평가 체계 설계, 데이터 설계 및 실패 분석에 있습니다. SFT, RLVR, rubric 기반 보상 및 Agent RL의 기본 원리를 이해하고 학습 목표, 데이터, grader, verifier, 보상 신호와 모델 성능의 관계를 분석할 수 있는 분을 찾습니다.
경력 연차나 기존 직무명으로 지원자를 제한하지 않습니다. 과거 직함보다 직접 수행한 프로젝트, 실제 기여 범위, 판단 과정과 검증 방법을 중요하게 평가합니다.
평가 과제, rubric, grader, verifier 및 Human Evaluation 프로세스를 설계하고 일관성, 안정성과 변별력을 검증합니다.
모델 출력, 도구 호출 기록 및 Agent 궤적을 분석해 문제의 원인이 모델, 데이터, 평가 과제, grader 또는 실행 환경 중 어디에 있는지 진단합니다.
실패 사례를 바탕으로 학습 데이터, 합성 데이터 및 평가 데이터를 설계하고 개선합니다.
코드 실행, 테스트 결과, 도구 피드백, 환경 상태 또는 rubric을 활용한 평가·보상 신호를 설계하고 검증합니다.
평가 데이터 오염, grader 취약점 및 reward hacking 가능성을 발견하고 개선합니다.
대조 실험, 표본 검토 및 기초 통계 분석을 통해 개선 효과가 실제로 유효한지 판단합니다.
Python을 활용해 데이터 처리, 모델 호출, 배치 평가, 자동 검증 및 결과 분석을 수행하고 실험의 추적 가능성과 재현성을 관리합니다.
Benchmark, rubric, LLM-as-a-Judge, grader, verifier 등 평가 방법을 활용해 본 분
평가 방법이 측정하는 역량과 평가 결과의 신뢰성을 검증하는 방법을 설명할 수 있는 분
모델 출력 또는 Agent 궤적에서 실패 유형을 도출하고 데이터나 평가 개선안으로 연결할 수 있는 분
Python으로 데이터 처리, 모델 호출 및 실험 분석을 독립적으로 수행할 수 있는 분
기본적인 실험 설계와 통계적 판단을 바탕으로 우연한 변동, 데이터 오염 및 채점 편향을 구분할 수 있는 분
SFT, RLVR, rubric 기반 보상 및 Agent RL 등 주요 포스트 트레이닝 방법을 이해하는 분
명확한 문서 작성과 협업 능력, 독립적인 업무 추진 능력을 갖춘 분
4년제 대학 학사 이상인 분 — 전공 무관
모델의 역량 목표와 실제 비즈니스 시나리오를 바탕으로 평가 과제, 데이터 기준 및 채점 방식을 설계합니다. 모델 출력과 Agent 행동 궤적을 분석해 구체적인 역량 부족을 파악하고, 이를 학습 데이터와 평가 데이터의 개선으로 연결합니다. 평가와 데이터 개선이 실제 모델 성능 향상으로 이어졌는지도 실험을 통해 검증합니다.
이 포지션의 핵심은 강화학습 알고리즘 개발 자체보다 평가 체계 설계, 데이터 설계 및 실패 분석에 있습니다. SFT, RLVR, rubric 기반 보상 및 Agent RL의 기본 원리를 이해하고 학습 목표, 데이터, grader, verifier, 보상 신호와 모델 성능의 관계를 분석할 수 있는 분을 찾습니다.
경력 연차나 기존 직무명으로 지원자를 제한하지 않습니다. 과거 직함보다 직접 수행한 프로젝트, 실제 기여 범위, 판단 과정과 검증 방법을 중요하게 평가합니다.
주요업무
모델 및 비즈니스 목표를 검증 가능한 역량 항목, 평가 과제, 난이도 분포와 평가 기준으로 구체화합니다.평가 과제, rubric, grader, verifier 및 Human Evaluation 프로세스를 설계하고 일관성, 안정성과 변별력을 검증합니다.
모델 출력, 도구 호출 기록 및 Agent 궤적을 분석해 문제의 원인이 모델, 데이터, 평가 과제, grader 또는 실행 환경 중 어디에 있는지 진단합니다.
실패 사례를 바탕으로 학습 데이터, 합성 데이터 및 평가 데이터를 설계하고 개선합니다.
코드 실행, 테스트 결과, 도구 피드백, 환경 상태 또는 rubric을 활용한 평가·보상 신호를 설계하고 검증합니다.
평가 데이터 오염, grader 취약점 및 reward hacking 가능성을 발견하고 개선합니다.
대조 실험, 표본 검토 및 기초 통계 분석을 통해 개선 효과가 실제로 유효한지 판단합니다.
Python을 활용해 데이터 처리, 모델 호출, 배치 평가, 자동 검증 및 결과 분석을 수행하고 실험의 추적 가능성과 재현성을 관리합니다.
자격요건
LLM 평가, 학습 데이터, 합성 데이터 또는 모델 품질 분석과 관련된 실무·프로젝트 경험이 있는 분Benchmark, rubric, LLM-as-a-Judge, grader, verifier 등 평가 방법을 활용해 본 분
평가 방법이 측정하는 역량과 평가 결과의 신뢰성을 검증하는 방법을 설명할 수 있는 분
모델 출력 또는 Agent 궤적에서 실패 유형을 도출하고 데이터나 평가 개선안으로 연결할 수 있는 분
Python으로 데이터 처리, 모델 호출 및 실험 분석을 독립적으로 수행할 수 있는 분
기본적인 실험 설계와 통계적 판단을 바탕으로 우연한 변동, 데이터 오염 및 채점 편향을 구분할 수 있는 분
SFT, RLVR, rubric 기반 보상 및 Agent RL 등 주요 포스트 트레이닝 방법을 이해하는 분
명확한 문서 작성과 협업 능력, 독립적인 업무 추진 능력을 갖춘 분
4년제 대학 학사 이상인 분 — 전공 무관

