포지션 상세
저희 팀은 복잡한 Biomedical Data를 기반으로 질병과 환자의 상태를 이해하고, 새로운 연구 가설을 발견하고 검증할 수 있는 AI Research System을 구축하고 있습니다.
Clinical/EHR, Imaging, Pathology, Omics 등 서로 다른 형태의 데이터를 통합하고, 이를 Knowledge Graph, AI Agent, World Model 및 Machine Learning Model과 연결하여 단순한 예측을 넘어 질병의 상태와 변화, 치료 반응의 원인을 이해할 수 있는 AI 시스템을 만드는 것을 목표로 합니다.
궁극적으로는 AI가 연구자의 반복적인 데이터 탐색과 분석을 보조하는 수준을 넘어, 가설 생성 Dry-lab 검증 Wet-lab 검증으로 이어지는 연구 과정의 효율성과 실험 성공 확률을 높이는 것을 목표로 합니다.
• 연구 질문과 활용 목적을 코호트 조건, 필요 변수, 가공 규칙, 산출물과 완료 기준이 정의된 태스크로 구체화하고 Dataset 구축
• Researcher 및 Domain Expert와 함께 Label, Outcome, Prediction Target과 Feature 구성을 정의하고, 라벨링 지침·검수 기준 및 작업 결과를 데이터셋에 반영
• 평가 목적에 맞는 환자·기관·시간 기준의 Sampling 및 Train / Validation / Test Split 설계와 Data Leakage·Label Leakage 검증
• 동일 환자의 방문·검체·모달리티 간 중복 및 예측 시점 이후 정보 유입 등 태스크별 누수 위험 점검
• Longitudinal / Temporal Patient Dataset 구축 및 EHR/EMR, Imaging, Pathology, Omics 등 Multi-modal Dataset Alignment
• 결측·중복, 라벨 오류, 데이터 분포 및 코호트 선택 편향을 점검하는 Dataset Quality / Distribution Validation Pipeline 구축
• 태스크별 추출·가공·검증 과정의 자동화와 Dataset 갱신·재생성 파이프라인 운영
• 입력 데이터 버전, 가공 코드·설정, 라벨·검수 이력 및 Split 정보를 연결한 Dataset Versioning, Snapshot 및 Benchmark 관리
• 사용·제공 가능한 범위와 제공 규격에 맞춰 Dataset을 구성하고, 코호트·라벨 정의, 데이터 사전, 품질 검증 결과, 이용 범위와 버전별 변경 내역을 포함한 제공 패키지 제작
• 연구 과제별 학습 데이터 확장
• Model Error, Failure Case, Hard Example 및 평가 결과를 분석하여 Dataset 개선 과제 도출
• AI Agent의 Reasoning / Tool-use / Research Trajectory 기록 수집·정제 및 검수
• AI/ML Engineer 및 Researcher와 협업하여 SFT, Preference Learning, RL 및 Post-training Dataset 구축과 Feedback Data Loop 운영
• ML Task에 맞는 Sampling, Train / Validation / Test Split 및 Validation 방법을 이해하고 적용할 수 있으신 분
• 데이터 분포, Bias, Leakage 및 Dataset Quality가 모델 성능과 평가에 미치는 영향을 이해하고, 관련 문제를 점검할 수 있으신 분
• 가공 코드·설정, 라벨, 데이터 버전을 관리하여 Dataset과 ML Experiment를 재현할 수 있으신 분
• 반복적인 데이터 처리·검증 과정을 재사용 가능한 코드나 파이프라인으로 구현할 수 있으신 분
• AI/ML Engineer, Researcher 및 Domain Expert와 협업하여 요구사항을 구체적인 가공·검수 기준과 데이터 산출물로 구현할 수 있으신 분
Clinical/EHR, Imaging, Pathology, Omics 등 서로 다른 형태의 데이터를 통합하고, 이를 Knowledge Graph, AI Agent, World Model 및 Machine Learning Model과 연결하여 단순한 예측을 넘어 질병의 상태와 변화, 치료 반응의 원인을 이해할 수 있는 AI 시스템을 만드는 것을 목표로 합니다.
궁극적으로는 AI가 연구자의 반복적인 데이터 탐색과 분석을 보조하는 수준을 넘어, 가설 생성 Dry-lab 검증 Wet-lab 검증으로 이어지는 연구 과정의 효율성과 실험 성공 확률을 높이는 것을 목표로 합니다.
주요업무
• 데이터셋 구축·검증 및 제공• 연구 질문과 활용 목적을 코호트 조건, 필요 변수, 가공 규칙, 산출물과 완료 기준이 정의된 태스크로 구체화하고 Dataset 구축
• Researcher 및 Domain Expert와 함께 Label, Outcome, Prediction Target과 Feature 구성을 정의하고, 라벨링 지침·검수 기준 및 작업 결과를 데이터셋에 반영
• 평가 목적에 맞는 환자·기관·시간 기준의 Sampling 및 Train / Validation / Test Split 설계와 Data Leakage·Label Leakage 검증
• 동일 환자의 방문·검체·모달리티 간 중복 및 예측 시점 이후 정보 유입 등 태스크별 누수 위험 점검
• Longitudinal / Temporal Patient Dataset 구축 및 EHR/EMR, Imaging, Pathology, Omics 등 Multi-modal Dataset Alignment
• 결측·중복, 라벨 오류, 데이터 분포 및 코호트 선택 편향을 점검하는 Dataset Quality / Distribution Validation Pipeline 구축
• 태스크별 추출·가공·검증 과정의 자동화와 Dataset 갱신·재생성 파이프라인 운영
• 입력 데이터 버전, 가공 코드·설정, 라벨·검수 이력 및 Split 정보를 연결한 Dataset Versioning, Snapshot 및 Benchmark 관리
• 사용·제공 가능한 범위와 제공 규격에 맞춰 Dataset을 구성하고, 코호트·라벨 정의, 데이터 사전, 품질 검증 결과, 이용 범위와 버전별 변경 내역을 포함한 제공 패키지 제작
• 연구 과제별 학습 데이터 확장
• Model Error, Failure Case, Hard Example 및 평가 결과를 분석하여 Dataset 개선 과제 도출
• AI Agent의 Reasoning / Tool-use / Research Trajectory 기록 수집·정제 및 검수
• AI/ML Engineer 및 Researcher와 협업하여 SFT, Preference Learning, RL 및 Post-training Dataset 구축과 Feedback Data Loop 운영
자격요건
• Python을 활용해 데이터를 추출·가공·검증하고, ML 학습·평가용 Dataset을 구축한 경험이 있으신 분• ML Task에 맞는 Sampling, Train / Validation / Test Split 및 Validation 방법을 이해하고 적용할 수 있으신 분
• 데이터 분포, Bias, Leakage 및 Dataset Quality가 모델 성능과 평가에 미치는 영향을 이해하고, 관련 문제를 점검할 수 있으신 분
• 가공 코드·설정, 라벨, 데이터 버전을 관리하여 Dataset과 ML Experiment를 재현할 수 있으신 분
• 반복적인 데이터 처리·검증 과정을 재사용 가능한 코드나 파이프라인으로 구현할 수 있으신 분
• AI/ML Engineer, Researcher 및 Domain Expert와 협업하여 요구사항을 구체적인 가공·검수 기준과 데이터 산출물로 구현할 수 있으신 분

