리소리우스-ML Data  Engineer
1/1
리소리우스∙서울 종로구∙신입-경력 35년

ML Data Engineer

포지션 상세

Team Vision

저희 팀은 복잡한 Biomedical Data를 기반으로 질병과 환자의 상태를 이해하고, 새로운 연구 가설을 발견하고 검증할 수 있는 AI Research System을 구축하고 있습니다.

Clinical/EHR, Imaging, Pathology, Omics 등 서로 다른 형태의 데이터를 통합하고, 이를 Knowledge Graph, AI Agent, World Model 및 Machine Learning Model과 연결하여 질병의 상태와 변화, 치료 반응의 원인을 이해할 수 있는 AI 시스템을 만드는 것을 목표로 합니다.

궁극적으로는 AI가 연구자의 반복적인 데이터 탐색과 분석을 보조하는 수준을 넘어, 가설 생성 Dry-lab 검증 Wet-lab 검증으로 이어지는 연구 과정의 효율성과 실험 성공 확률을 높이는 것을 목표로 합니다.

포지션 소개

ML Data Engineer는 수집·통합된 Biomedical Data를 연구 목적과 ML Task에 맞게 가공하여, 모델 학습·평가와 외부 고객 제공에 사용할 수 있는 Dataset으로 만드는 역할을 담당합니다.

Data Ingestion Engineer가 구축한 데이터 기반 위에서 AI/ML Engineer, Researcher, Domain Expert와 함께 Patient Cohort, Label, Outcome, Feature 및 평가 기준을 구체화합니다. 이를 바탕으로 데이터 추출·가공, Sampling, Split, Labeling 및 Validation Pipeline을 설계하고 운영합니다.

각 태스크의 결과를 검증된 Dataset과 관련 문서로 완성하고, 데이터의 버전·가공 이력·품질을 관리하여 동일한 결과를 재현하고 반복 활용할 수 있도록 합니다.

연구 과제에 따라 Longitudinal Patient Dataset, Agent Trajectory, SFT/Preference Dataset, RL 및 Post-training Dataset으로 학습 데이터의 범위를 확장합니다. 모델팀과 협업하여 실험 및 평가 결과를 다음 Dataset의 개선으로 연결합니다.

주요업무

데이터셋 구축·검증 및 제공

• 연구 질문과 활용 목적을 코호트 조건, 필요 변수, 가공 규칙, 산출물과 완료 기준이 정의된 태스크로 구체화하고 Dataset 구축
• Researcher 및 Domain Expert와 함께 Label, Outcome, Prediction Target과 Feature 구성을 정의하고, 라벨링 지침·검수 기준 및 작업 결과를 데이터셋에 반영
• 평가 목적에 맞는 환자·기관·시간 기준의 Sampling 및 Train / Validation / Test Split 설계와 Data Leakage·Label Leakage 검증
• 동일 환자의 방문·검체·모달리티 간 중복 및 예측 시점 이후 정보 유입 등 태스크별 누수 위험 점검
• Longitudinal / Temporal Patient Dataset 구축 및 EHR/EMR, Imaging, Pathology, Omics 등 Multi-modal Dataset Alignment
• 결측·중복, 라벨 오류, 데이터 분포 및 코호트 선택 편향을 점검하는 Dataset Quality / Distribution Validation Pipeline 구축
• 태스크별 추출·가공·검증 과정의 자동화와 Dataset 갱신·재생성 파이프라인 운영
• 입력 데이터 버전, 가공 코드·설정, 라벨·검수 이력 및 Split 정보를 연결한 Dataset Versioning, Snapshot 및 Benchmark 관리
• 사용·제공 가능한 범위와 제공 규격에 맞춰 Dataset을 구성하고, 코호트·라벨 정의, 데이터 사전, 품질 검증 결과, 이용 범위와 버전별 변경 내역을 포함한 제공 패키지 제작

연구 과제별 학습 데이터 확장

• Model Error, Failure Case, Hard Example 및 평가 결과를 분석하여 Dataset 개선 과제 도출
• AI Agent의 Reasoning / Tool-use / Research Trajectory 기록 수집·정제 및 검수
• AI/ML Engineer 및 Researcher와 협업하여 SFT, Preference Learning, RL 및 Post-training Dataset 구축과 Feedback Data Loop 운영

자격요건

• Python을 활용해 데이터를 추출·가공·검증하고, ML 학습·평가용 Dataset을 구축한 경험이 있으신 분
• ML Task에 맞는 Sampling, Train / Validation / Test Split 및 Validation 방법을 이해하고 적용할 수 있으신 분
• 데이터 분포, Bias, Leakage 및 Dataset Quality가 모델 성능과 평가에 미치는 영향을 이해하고, 관련 문제를 점검할 수 있으신 분
• 가공 코드·설정, 라벨, 데이터 버전을 관리하여 Dataset과 ML Experiment를 재현할 수 있으신 분
• 반복적인 데이터 처리·검증 과정을 재사용 가능한 코드나 파이프라인으로 구현할 수 있으신 분
• AI/ML Engineer, Researcher 및 Domain Expert와 협업하여 요구사항을 구체적인 가공·검수 기준과 데이터 산출물로 구현할 수 있으신 분

기술 스택 • 툴

태그

마감일

상시채용

근무지역

서울 종로구 대학로 116, 4층
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>

더 많은 포지션을 찾아 볼까요?

지원할 만한 매력적인 포지션들이 기다리고 있어요.