포지션 상세
" 플리토리안은
안되는 이유를 찾기보다는
해낼 수 있는 방법을 고민하고,
협업을 통해 함께 성취하며 성장합니다. "
플리토는 유수의 글로벌 IT 기업들과 협력하며 AI 개발을 지원하는 'AI를 위한 데이터 파트너'입니다.
고객의 모델이 무엇을 배워야 하는지 파악하는 데서 출발해 필요한 데이터를 설계·생산·검증합니다. 사전학습용 코퍼스와 RLHF·SFT 같은 정렬 데이터, 모델 성능을 재는 벤치마크·평가 데이터까지 텍스트·이미지·오디오·비디오를 아우르는 데이터셋을 제공합니다.
173개국 1,400만 명이 참여하는 크라우드소싱 플랫폼 플리토 아케이드(Arcade)의 크라우드와 분야별 전문 작업자가 데이터를 제작하고, 전문가가 이를 검수합니다.
플리토는 국내외 AI 기업에 대규모 데이터를 생산·판매하며 역량을 쌓아왔습니다. 지금은 AI 기술의 변화에 맞춰 새로운 데이터 영역으로 사업을 넓혀가고 있습니다.
AI의 성능은 결국 데이터가 결정합니다. 플리토에서 AI가 아직 배우지 못한 현실의 데이터를 채워 나가는 도전에 함께할 분들의 지원을 기다립니다.
클라우드 에이전트 워크스페이스에서 에이전트 트레젝토리(trajectory)를 만들고, RLHF 벤치를 구성하고, 그 결과로 다음 벤치마크를 설계합니다.
특정 도메인 전공을 요구하지 않습니다. 코드, 보안, 업무 자동화, 도구 사용, 문서 작업 등 에이전트가 실제로 하는 일이라면 무엇이든 평가 대상이 됩니다. 본인이 잘 아는 분야에서 “어려운 과제가 무엇이고 무엇이 정답인지” 판단할 수 있으면 됩니다.
작업자들이 쓸 Task와 보상 설계 하네스를 만들어 전달하고, 올라온 결과로 모델을 돌린 뒤, 그 결과를 보고 기준을 다듬어 다시 요청하는 흐름으로 일합니다. 처음에는 이미 진행 중인 Task를 함께 돌려보며 시작합니다.
• 작업자가 쓸 Task 스펙과 보상(reward) · 검증기(verifier) 를 설계하고 하네스 형태로 전달합니다.
※SWE-bench · Terminal-Bench · OSWorld 같은 실행 환경부터
GDPval · τ-bench · APEX-Agents 같은 실무 과제 벤치마크까지, 형태는 다양합니다.
• 클라우드 에이전트 워크스페이스에서 에이전트 트레젝토리를 수집하고 품질을 점검합니다.
• 취합한 데이터로 모델을 실행하고, 결과를 분석해 보상과 채점 기준을 다듬습니다.
• 수집한 트레젝토리를 바탕으로 RLHF 벤치를 구성하고, 다음 벤치마크를 설계합니다.
• 생산된 트레젝토리와 평가 결과를 벡터 DB로 연결해 활용합니다.
• Python으로 파이프라인을 직접 만들고 운영해 본 경험
• LLM API 또는 오픈모델을 다뤄본 경험 (에이전트 실행, 출력 파싱 · 검증)
• 본인이 잘 아는 분야에서 과제의 난이도와 정답을 직접 판단할 수 있는 수준의 전문성
※ 분야는 무관합니다
• 경력 3년 이상
• 숫자가 어디서 나왔는지 설명할 수 있게 기록을 남기시는 분
• 무엇을 측정할지부터 정리하고 시작하시는 분
• 자기 기준을 다른 사람이 따라 할 수 있는 형태로 정리하실 수 있는 분
안되는 이유를 찾기보다는
해낼 수 있는 방법을 고민하고,
협업을 통해 함께 성취하며 성장합니다. "
플리토는 유수의 글로벌 IT 기업들과 협력하며 AI 개발을 지원하는 'AI를 위한 데이터 파트너'입니다.
고객의 모델이 무엇을 배워야 하는지 파악하는 데서 출발해 필요한 데이터를 설계·생산·검증합니다. 사전학습용 코퍼스와 RLHF·SFT 같은 정렬 데이터, 모델 성능을 재는 벤치마크·평가 데이터까지 텍스트·이미지·오디오·비디오를 아우르는 데이터셋을 제공합니다.
173개국 1,400만 명이 참여하는 크라우드소싱 플랫폼 플리토 아케이드(Arcade)의 크라우드와 분야별 전문 작업자가 데이터를 제작하고, 전문가가 이를 검수합니다.
플리토는 국내외 AI 기업에 대규모 데이터를 생산·판매하며 역량을 쌓아왔습니다. 지금은 AI 기술의 변화에 맞춰 새로운 데이터 영역으로 사업을 넓혀가고 있습니다.
AI의 성능은 결국 데이터가 결정합니다. 플리토에서 AI가 아직 배우지 못한 현실의 데이터를 채워 나가는 도전에 함께할 분들의 지원을 기다립니다.
주요업무
플리토는 AI 데이터 · 평가 사업으로 무게중심을 옮기고 있습니다. 이 포지션은 에이전트 학습·평가 데이터를 직접 만드는 일을 합니다.클라우드 에이전트 워크스페이스에서 에이전트 트레젝토리(trajectory)를 만들고, RLHF 벤치를 구성하고, 그 결과로 다음 벤치마크를 설계합니다.
특정 도메인 전공을 요구하지 않습니다. 코드, 보안, 업무 자동화, 도구 사용, 문서 작업 등 에이전트가 실제로 하는 일이라면 무엇이든 평가 대상이 됩니다. 본인이 잘 아는 분야에서 “어려운 과제가 무엇이고 무엇이 정답인지” 판단할 수 있으면 됩니다.
작업자들이 쓸 Task와 보상 설계 하네스를 만들어 전달하고, 올라온 결과로 모델을 돌린 뒤, 그 결과를 보고 기준을 다듬어 다시 요청하는 흐름으로 일합니다. 처음에는 이미 진행 중인 Task를 함께 돌려보며 시작합니다.
• 작업자가 쓸 Task 스펙과 보상(reward) · 검증기(verifier) 를 설계하고 하네스 형태로 전달합니다.
※SWE-bench · Terminal-Bench · OSWorld 같은 실행 환경부터
GDPval · τ-bench · APEX-Agents 같은 실무 과제 벤치마크까지, 형태는 다양합니다.
• 클라우드 에이전트 워크스페이스에서 에이전트 트레젝토리를 수집하고 품질을 점검합니다.
• 취합한 데이터로 모델을 실행하고, 결과를 분석해 보상과 채점 기준을 다듬습니다.
• 수집한 트레젝토리를 바탕으로 RLHF 벤치를 구성하고, 다음 벤치마크를 설계합니다.
• 생산된 트레젝토리와 평가 결과를 벡터 DB로 연결해 활용합니다.
자격요건
• 벤치마크를 직접 만들고 분석해 본 경험 — 문항을 설계하고, 채점 기준을 정하고, 결과를 분석해 기준을 다듬어 본 경험• Python으로 파이프라인을 직접 만들고 운영해 본 경험
• LLM API 또는 오픈모델을 다뤄본 경험 (에이전트 실행, 출력 파싱 · 검증)
• 본인이 잘 아는 분야에서 과제의 난이도와 정답을 직접 판단할 수 있는 수준의 전문성
※ 분야는 무관합니다
• 경력 3년 이상
• 숫자가 어디서 나왔는지 설명할 수 있게 기록을 남기시는 분
• 무엇을 측정할지부터 정리하고 시작하시는 분
• 자기 기준을 다른 사람이 따라 할 수 있는 형태로 정리하실 수 있는 분



