에버엑스-[기술혁신실] AI Software Engineer(VLM-Eval)
에버엑스-[기술혁신실] AI Software Engineer(VLM-Eval)
에버엑스-[기술혁신실] AI Software Engineer(VLM-Eval)
1/3
에버엑스서울 서초구경력 3년 이상

[기술혁신실] AI Software Engineer(VLM-Eval)

포지션 상세

[합류하게 될 팀에 대해 알려드려요]

"Bringing Personalized Rehabilitation to Everyone"이라는 Mission 아래, EverEx는 디지털 헬스케어 기술로 재활 치료의 패러다임을 바꾸고 있어요.

기술혁신실 AI팀은 Human Pose Estimation 기술로 사용자의 움직임을 정확하게 분석해왔고, 이제 실제 운동/재활 전문가처럼 자세와 동작을 이해하고 실시간으로 피드백하는 자체 VideoLLM을 만드는 일에 도전해요.

그런데, 이런 모델은 만드는 것만큼이나 "제대로 하고 있는지 증명하는 것"이 어려워요. Pose Estimation은 예측한 관절 좌표를 정답과 비교하면 됐지만, VideoLLM이 내놓는 피드백은 정답이 하나가 아니에요. 게다가 우리 서비스에서 잘못된 피드백은 단순한 오답이 아니라 사용자의 부상이나 재활 지연으로 이어질 수 있어요.

그래서, 우리는 모델 개발과 나란히, "이 모델을 사용자에게 내보내도 되는가"에 근거를 가지고 답할 수 있는 검증 체계를 만들 동료를 찾고 있어요. 무엇이 좋은 피드백인지를 측정 가능한 기준으로 옮기고, 재현 가능한 평가 파이프라인을 만들고, 모델이 바뀔 때마다 무엇이 좋아지고 무엇이 나빠졌는지 자동으로 드러나게 만드는 일이에요.

평가 데이터셋도, 벤치마크도, 파이프라인도 처음부터 함께 만들어나가는 과정에 합류하여 기여할 수 있어요.

주요업무

• VideoLLM 평가 데이터셋과 벤치마크를 직접 만들어요. 실제 운동·재활 영상을 기반으로 "이 상황에서 전문가라면 어떤 피드백을 줄 것인가"를 정의하고, 이를 평가 가능한 형태로 구조화해요. 의학팀, 데이터 매니저와 함께 정답과 채점 기준(rubric)을 설계하고, Annotation 가이드라인을 작성하고, 평가자 간 일치도를 관리하는 일까지 포함돼요.
• 자동 채점 파이프라인을 설계하고 구현해요. 규칙 기반 지표만으로는 자연어 피드백의 품질을 담을 수 없어요. LLM/MLLM-as-a-Judge를 도입하고, judge 자체가 신뢰할 만한지를 사람의 평가와 대조해 검증하고, 위치 편향, 자기 편향 같은 알려진 문제를 완화하는 것까지가 이 업무의 범위예요.
• 학습 체크포인트마다 자동으로 돌아가는 평가 하네스를 만들어요. 모델이 바뀔 때마다 사람이 수동으로 돌려보는 구조가 아니라, 학습·배포 파이프라인에 상시 물려 있는 평가 시스템을 만들어요. 사내 모델 라이프사이클 플랫폼(FlowEx)의 평가 보드와 연동해 결과가 자동으로 축적되고 비교되도록 하고, 성능 회귀가 발생하면 놓치지 않고 드러나게 만들어요.
• 정확도 외의 평가축을 구현해요. 답변의 정확성뿐 아니라 안전성(위험한 동작 지시 여부), 일관성, 환각(hallucination), 응답 지연까지, 헬스케어 서비스에 요구되는 여러 관점을 각각 정량화해요. 특히 실시간 피드백이 목표인 만큼, 서비스 환경의 지연 조건 아래에서의 품질을 측정하는 것도 중요한 과제예요.
• 실패 사례를 분석하고 개선 루프로 되돌려요. 평가에서 드러난 실패 사례를 수집 및 유형화(categorize)해서 연구자에게 전달하고, 그 사례를 다시 평가셋에 반영해 평가 체계 자체를 계속 강화해요. 평가 결과가 이상할 때, 모델의 변화 때문인지 파이프라인 문제인지 규명하는 것도 이 역할의 몫이에요.
• 의학팀과 함께 임상적 타당성 검증 체계를 만들어요. 기술적 지표를 넘어, 모델의 피드백이 임상적으로 타당한지를 어떻게 확인할 것인지 검증 프로토콜을 함께 설계해요. ISO/IEC 42001이 요구하는 재현 가능성과 감사 추적성을 평가 과정에서도 시스템 수준으로 보장해요.
• 다양한 직군과 협업해요. AI Research Engineer(모델 개발), MLOps Engineer(파이프라인·인프라), 의학팀, 제품팀, RA/QA와 긴밀히 협업해요. 특히 AI Research Engineer와는 "무엇이 좋은 피드백인가"를 함께 정의하고, 그것을 측정 가능한 시스템으로 옮기는 역할을 맡아요.

자격요건

• Python으로 실험·평가 파이프라인을 직접 설계하고 구현할 수 있는 분이면 좋아요. 이 역할은 분석 리포트를 쓰는 일이 아니라, 돌아가는 시스템을 만드는 일이에요.
• LLM 또는 Multimodal LLM을 다뤄본 경험이 있는 분이면 좋아요. 직접 학습시켜본 경험까지는 아니더라도, 모델이 어떻게 동작하고 어떤 방식으로 실패하는지를 이해하고 계셔야 해요.
• 관련 분야 경력 3년 이상, 또는 그에 준하는 실력을 프로젝트로 입증할 수 있는 분을 찾고 있어요. 우리에게 중요한 건 연차가 아니라 경험이에요.
• 모호한 품질 문제를 측정 가능한 지표로 바꿔본 경험이 있는 분이면 좋아요. "왠지 답변이 별로다"를 "무엇이 얼마나 나쁜지"로 옮기는 일이 이 직무의 핵심이에요. 꼭 LLM이 아니어도, 정답이 명확하지 않은 문제를 정량화해본 경험이면 충분해요.
• 진행 상황을 유기적으로 공유하고, 문서를 통해 소통하는 것에 익숙하신 분이면 좋아요. 규제 산업에서는 "무엇을 어떻게 검증했는지"의 기록 자체가 결과물이에요.

기술 스택 • 툴

태그

마감일

상시채용

근무지역

서울 서초구 강남대로 311, 12층 에버엑스
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>

더 많은 포지션을 찾아 볼까요?

지원할 만한 매력적인 포지션들이 기다리고 있어요.