포지션 상세
크라우드웍스는 국내 인공지능 데이터 산업을 주도하는 IT 기업으로서 지난 2023년 8월 31일, 설립 6년만에 국내 AI 스타트업 중 최초로 한국거래소 코스닥 시장에 상장하였습니다. 크라우드웍스는 네이버, 삼성전자, 크래프톤을 포함한 약 430여개의 고객사들에게 인공지능 모델 개발에 필요한 형태의 AI Data를 공급한 경험이 있으며, 약 2억개 이상의 누적데이터와 1천 건 이상의 프로젝트 운영 경험을 바탕으로 각 수요기업에게 적합한 맞춤형 A to Z 서비스까지 제공하고 있습니다.
또한, 기업 고객뿐만 아니라 원하는 시간과 장소에서, 원하는 만큼 일하며 소득을 창출하고 싶어하는 50만명 이상의 크라우드웍스 회원에게는 꾸준한 일자리와 함께 다양한 인공지능 데이터 작업에 참여할 수 있는 기회를 제공함으로써 기업의 사회적 책임도 다하고자 하고 있습니다.
전세계적으로 확대되고 있는 인공지능 기술에 대한 관심과 데이터의 수요에 맞게 크라우드웍스 역시 기존의 인공지능 데이터 비즈니스 뿐만 아니라 AI 기술 개발 가치사슬 전 단계를 제공하는 통합 데이터 솔루션 회사로 나아가고자 노력하고 있으며, 이를 통해 궁극적으로 사람과 인공지능이 함께 성장하는 새로운 미래를 만들어가고자 합니다.
저희와 함께 다양한 산업의 데이터를 구조화하고, 이를 AI가 이해하고 활용할 수 있는 지식 체계로 만들어갈 동료를 기다리고 있습니다.
크라우드웍스 데이터플랫폼팀은 기업이 보유한 정형·비정형 데이터를 수집하고 가공하여 검색, RAG, LLM, Agent 등 다양한 AI 서비스에서 활용할 수 있도록 데이터 플랫폼을 개발하고 있습니다.
Document AI Engineer는 그 시작점에서, 문서를 AI가 이해하고 활용할 수 있는 구조화된 데이터로 변환하는 Knowledge Compiler를 개발합니다. 우리가 해결하려는 문제는 단순히 문서에서 텍스트를 추출하는 것이 아닙니다. 문서가 가진 제목과 계층, 읽는 순서, 표, 수식, 이미지와 같은 구조와 의미를 최대한 보존하여 이후 검색, RAG, 지식그래프, AI Agent까지 활용할 수 있는 데이터 기반을 만드는 것이 목표입니다.
수백만 건의 실제 문서를 대상으로 다양한 문서 형식과 예외 상황을 다루며, 한정된 CPU·GPU 자원과 온프레미스·폐쇄망 환경에서도 높은 품질과 처리 성능을 유지할 수 있는 Document AI 엔진을 만들어갑니다. 이를 위해 OCR, Layout Detection, VLM 등 다양한 기술을 조합하고, 필요하다면 기존 방식을 과감히 대체합니다. 새로운 모델이나 논문을 검증하는 것에 그치지 않고, 실제 제품에서 재현 가능하고 지속적으로 개선 가능한 형태로 만드는 것을 중요하게 생각합니다. 새로운 기술로 기존 파이프라인을 대체할 수 있는지 끊임없이 실험하며 주어진 환경에서 가장 좋은 답을 찾아가는 포지션입니다.
• 문서의 읽는 순서, 표·수식·문서 계층 등 원래 문서가 가진 구조를 복원하는 알고리즘을 설계하고 구현
• Layout Detection, OCR, VLM 등 오픈소스 모델을 파이프라인에 적용하고 개선
• 제한된 CPU·GPU 자원과 폐쇄망 환경에서도 대량의 문서를 안정적으로 처리할 수 있도록 최적화
• 실패 케이스를 유형화하고, 이를 측정할 평가 데이터셋과 지표를 직접 설계
• 변경마다 품질 향상과 회귀를 검증하는 체계 구축·운영
• 새로운 기술을 빠르게 검증하고, 기존 파이프라인보다 나은 경우 적용 방안 모색
• 정의가 모호한 문제를 측정 가능한 형태로 정의하고 구현해본 경험이 있는 분
• 실패 케이스를 분석하고, 원인을 찾아 일반화 가능한 개선으로 연결할 수 있는 분
• 코드 리뷰와 테스트를 중요하게 생각하고, 설계의 근거를 논의할 수 있는 분
또한, 기업 고객뿐만 아니라 원하는 시간과 장소에서, 원하는 만큼 일하며 소득을 창출하고 싶어하는 50만명 이상의 크라우드웍스 회원에게는 꾸준한 일자리와 함께 다양한 인공지능 데이터 작업에 참여할 수 있는 기회를 제공함으로써 기업의 사회적 책임도 다하고자 하고 있습니다.
전세계적으로 확대되고 있는 인공지능 기술에 대한 관심과 데이터의 수요에 맞게 크라우드웍스 역시 기존의 인공지능 데이터 비즈니스 뿐만 아니라 AI 기술 개발 가치사슬 전 단계를 제공하는 통합 데이터 솔루션 회사로 나아가고자 노력하고 있으며, 이를 통해 궁극적으로 사람과 인공지능이 함께 성장하는 새로운 미래를 만들어가고자 합니다.
저희와 함께 다양한 산업의 데이터를 구조화하고, 이를 AI가 이해하고 활용할 수 있는 지식 체계로 만들어갈 동료를 기다리고 있습니다.
주요업무
※ Document AI Engineer의 역할크라우드웍스 데이터플랫폼팀은 기업이 보유한 정형·비정형 데이터를 수집하고 가공하여 검색, RAG, LLM, Agent 등 다양한 AI 서비스에서 활용할 수 있도록 데이터 플랫폼을 개발하고 있습니다.
Document AI Engineer는 그 시작점에서, 문서를 AI가 이해하고 활용할 수 있는 구조화된 데이터로 변환하는 Knowledge Compiler를 개발합니다. 우리가 해결하려는 문제는 단순히 문서에서 텍스트를 추출하는 것이 아닙니다. 문서가 가진 제목과 계층, 읽는 순서, 표, 수식, 이미지와 같은 구조와 의미를 최대한 보존하여 이후 검색, RAG, 지식그래프, AI Agent까지 활용할 수 있는 데이터 기반을 만드는 것이 목표입니다.
수백만 건의 실제 문서를 대상으로 다양한 문서 형식과 예외 상황을 다루며, 한정된 CPU·GPU 자원과 온프레미스·폐쇄망 환경에서도 높은 품질과 처리 성능을 유지할 수 있는 Document AI 엔진을 만들어갑니다. 이를 위해 OCR, Layout Detection, VLM 등 다양한 기술을 조합하고, 필요하다면 기존 방식을 과감히 대체합니다. 새로운 모델이나 논문을 검증하는 것에 그치지 않고, 실제 제품에서 재현 가능하고 지속적으로 개선 가능한 형태로 만드는 것을 중요하게 생각합니다. 새로운 기술로 기존 파이프라인을 대체할 수 있는지 끊임없이 실험하며 주어진 환경에서 가장 좋은 답을 찾아가는 포지션입니다.
• 문서의 읽는 순서, 표·수식·문서 계층 등 원래 문서가 가진 구조를 복원하는 알고리즘을 설계하고 구현
• Layout Detection, OCR, VLM 등 오픈소스 모델을 파이프라인에 적용하고 개선
• 제한된 CPU·GPU 자원과 폐쇄망 환경에서도 대량의 문서를 안정적으로 처리할 수 있도록 최적화
• 실패 케이스를 유형화하고, 이를 측정할 평가 데이터셋과 지표를 직접 설계
• 변경마다 품질 향상과 회귀를 검증하는 체계 구축·운영
• 새로운 기술을 빠르게 검증하고, 기존 파이프라인보다 나은 경우 적용 방안 모색
자격요건
• 컴퓨터공학, 인공지능 등 관련 전공 학사 또는 그에 준하는 실무 경험• 정의가 모호한 문제를 측정 가능한 형태로 정의하고 구현해본 경험이 있는 분
• 실패 케이스를 분석하고, 원인을 찾아 일반화 가능한 개선으로 연결할 수 있는 분
• 코드 리뷰와 테스트를 중요하게 생각하고, 설계의 근거를 논의할 수 있는 분










