콕스웨이브-[AX krewa] 리서치 엔지니어
콕스웨이브-[AX krewa] 리서치 엔지니어
콕스웨이브-[AX krewa] 리서치 엔지니어
콕스웨이브-[AX krewa] 리서치 엔지니어
콕스웨이브-[AX krewa] 리서치 엔지니어
1/5
콕스웨이브서울 영등포구경력 3-35년

[AX krewa] 리서치 엔지니어

포지션 상세

[AX Team, krewa]
• krewa는 기업이 AI에게 중요한 업무를 위임할 수 있는 운영 기반을 만들어요.
• AI 모델은 이미 문서를 읽고, 판단하고, 도구를 사용할 만큼 강력해졌어요. 하지만 기업 현장에서는 여전히 사람이 결과를 전부 다시 확인해요. 80%가 맞아도 어느 20%가 틀렸는지 모르면 결국 100%를 검토해야 하니까요. AI가 아직 '초안 도우미'에 머물러 있고 이 상태로는 중요한 업무를 AI에게 맡길 수 없어요.
• krewa는 이걸 모델 성능이 아니라 실행 구조로 풀고 있어요. AI Worker가 업무를 수행하고, Trust System이 실행 전 과정을 검증해요. 위험이 감지되면 실행을 멈추고 사람의 판단을 받은 뒤 다시 이어가요. 그 판단은 다음 실행을 더 정확하고 안전하게 만드는 데 활용돼요.
• 이를 통해 사람의 판단이 필요해 자동화하기 어려웠던 반복 업무까지 AI에게 위임할 수 있게 해요. 직원은 반복적인 처리와 검토에서 벗어나, 자신의 전문성이 더 필요한 일에 집중할 수 있어요.
• AI가 업무를 돕는 시대에서, 업무를 맡는 시대로. krewa는 AI가 기업 운영의 한 축이 되는 미래를 만들고 있어요.

[krewa 를 만들어온 여정]
• AI를 평가하는 데서, 실행을 통제하는 데까지
-- AI가 내린 판단과 업무 수행 과정을 검증하는 일은 콕스웨이브가 2021년부터 풀어온 문제예요.
-- AI Agent 성능 평가 솔루션을 운영하며 300개 이상의 글로벌 고객사에 품질 평가와 분석 기능을 제공했어요.
-- 금융 고객사의 실제 업무 데이터를 월 수십만 건 규모로 분석하고 평가하고 있어요.
-- 독자 파운데이션 모델의 지시 이행 성능을 평가하는 기준을 만들고, 평가 데이터의 품질을 검증했어요.
-- 2025년부터 AI의 이상 행동을 탐지하는 기술을 개발하고 있어요.
-- AI 실행 통제 관련 국가 표준화 작업에 참여하고 있어요.
-- 행정안전부, 국가인공지능위원회 등 여러 기관에 AI Agent 통제 기술을 자문했어요.

• 연구를 넘어, 제품과 시장에서 증명해 왔어요
-- 우리는 기술을 연구하는 데서 멈추지 않고, 실제 제품과 고객의 성과로 연결해 왔어요.
-- 국내 최초의 생성형 AI 서비스 매각 사례를 만들었어요.
-- 2023년부터 Microsoft의 Agent Orchestration 오픈소스 프로젝트에 코어 컨트리뷰터로 참여하고 있어요.
-- Meta, PwC 등 글로벌 기업의 AX 프로젝트를 수행하고, 현대차를 비롯한 여러 기업에 AI Agent 연구와 개발을 자문했어요.
-- NVIDIA, Anthropic, OpenAI 등 글로벌 기술 기업과 협업하고 파트너십을 구축했어요.
-- Anthropic, OpenAI와 서밋과 해커톤을 공동 개최하며 국내 AI 생태계의 성장을 함께 만들어 왔어요.

[지금 krewa 팀에 합류한다는 것]
• krewa는 아이디어만 있는 단계도, 답이 모두 정해진 단계도 아니에요. 고객사와 실제 Agent 를 만들며 반복적으로 나타나는 문제를 발견하고, 그 해법을 표준 Krewa와 Trust System의 공통 기능으로 발전시키는 단계에 있어요.
• Agent는 여러 단계에 걸쳐 판단하고 도구를 사용하기 때문에 최종 결과만 확인해서는 어디서 왜 실패했는지 알기 어려워요. 형식이나 정책을 위반할 수 있고, 근거 없이 판단하거나 잘못된 도구를 호출할 수도 있어요. 개별 판단은 맞더라도 전체 실행 흐름이 의도와 다르게 진행될 수도 있어요.
• 우리는 이런 실패를 사후에 평가하는 데서 멈추지 않으려고 해요. Agent의 실행을 관찰하고, 위험을 탐지하고, 원인을 추적하고, 필요한 경우 실행을 중단하거나 사람의 판단을 요청할 수 있는 Trust System을 만들고 있어요.
• Trust System은 특정 Agent Framework에 종속되지 않는 독립적인 시스템을 지향해요. krewa뿐 아니라 다른 Agent Workflow에도 연결할 수 있도록 공통 실행 정보와 판단 인터페이스를 설계해야 해요. 동시에 고객 현장의 구체적인 실패를 실제로 해결하면서, 어떤 기술이 제품에서 유효한지 증명해야 해요.

[이런 분과 함께하고 싶어요]
• 이 포지션은 Agent의 실패를 연구하고, 이를 실제로 탐지하고 통제할 수 있는 Trust System의 기능으로 구현하는 Research Engineer예요.
• 논문을 읽고 실험하는 데서 끝나지 않아요. 고객 환경에서 발견한 실패를 데이터와 평가 문제로 구체화하고, 탐지 모델과 평가 파이프라인을 구현하며, 검증된 결과를 동료 연구자 및 엔지니어와 함께 실제 제품에 적용해요. 제품 개발 과정에서 얻은 결과는 다시 연구로 발전시켜 논문과 특허로 남겨요.
• 경력 수준에 따라 명확하게 정의된 연구 또는 기능을 맡는 것부터, 하나의 연구·개발 과제를 독립적으로 이끌고 동료의 설계와 실험을 리뷰하는 것까지 역할 범위가 달라질 수 있어요.
• 연차보다 실제로 해결해 본 문제와 성장 가능성을 중요하게 봐요. 모든 경험을 이미 갖춘 사람보다, 자신의 강점이 분명하고 부족한 부분을 동료와 함께 빠르게 학습하며 결과를 완성할 수 있는 사람을 찾아요.

[합류 후 함께할 일]
• 고객사의 실제 Agent Workflow에서 발생하는 실패 사례를 분석하고, 재현 가능한 데이터와 평가 문제로 만들어요.
• Agent의 실행 정보를 수집하고 위험을 탐지하며, 필요한 경우 실행을 중단하거나 사람의 승인을 요청할 수 있는 Trust System을 함께 구축해요.
• 특정 고객을 위해 만든 해법에서 공통 요소를 찾아 표준 Krewa에 적용할 수 있는 기능으로 발전시켜요.
• 제품 문제에서 연구 질문을 발굴하고, 실험과 benchmark를 구축하여 탑티어 학회 논문과 특허에 기여해요.
• 연구 결과가 실험에 머물지 않고 안정적인 프로덕션 시스템에서 작동하도록 연구자 및 엔지니어와 함께 구현하고 검증해요.

주요업무

• Trust System 기술 전략 및 아키텍처
-- Agent의 어떤 실패를 다룰지 함께 정의하고, 이를 판단하기 위해 필요한 실행 정보와 신호를 탐색해요.
-- krewa와 외부 Agent Workflow에 연결되는 trace, event schema, 판단 API와 제어 기능을 설계하고 구현해요.
-- 탐지 정확도뿐 아니라 오탐과 미탐, 응답 지연, 비용, 설명 가능성 및 운영 안정성을 실험하고 개선해요.

• Agent 오류 탐지 및 실행 통제
-- 규칙과 정책 기반 검증, LLM 기반 평가, ML 기반 이상 탐지 등을 활용하여 Agent의 오류와 의도하지 않은 행동을 탐지해요.
-- 환각, 추론 오류, 정책 위반, 잘못된 도구 호출, 일관성 오류 등 주요 실패의 원인을 실행 단계별로 분석해요.
-- 위험 수준과 판단 근거에 따라 실행 허용, 중단, 재시도, 대체 경로 또는 Human-in-the-loop로 연결되는 기능을 구현해요.

• 평가 체계 및 개선 루프
-- Agent의 실패를 일관되게 분류할 수 있는 failure taxonomy와 benchmark 데이터셋을 만들어요.
-- Grader, human evaluation 및 자동화된 평가 파이프라인을 구현하고 평가 결과의 신뢰도와 재현성을 검증해요.
-- 실행 결과와 사람의 피드백을 prompt, retrieval, memory, workflow와 Trust System 개선으로 연결해요.

• Research-to-Production
-- 최신 연구를 읽고 핵심 아이디어를 빠르게 구현하여 실제 제품 문제에 유효한지 실험해요.
-- 실험 코드를 테스트 가능하고 관찰 가능한 프로덕션 코드로 발전시키고 실제 환경에서 운영 결과를 확인해요.
-- 고객사별 구현에서 공통 원리와 재사용 가능한 기능을 찾아 표준 Krewa와 Trust System의 제품 자산으로 만들어요.

• 논문 및 지식재산화
-- Agent Reliability, failure attribution, online auditing, anomaly detection, runtime control 등 제품과 연결되는 연구에 참여해요.
-- 재현 가능한 실험을 설계하고 결과를 분석하며, 경력과 기여 범위에 따라 논문 작성 및 투고를 주도하거나 공동 저자로 참여해요.
-- 업무 과정에서 발견한 독창적인 기술을 특허와 기술 보고서로 정리하는 데 기여해요.

자격요건

• Python을 사용하여 데이터 처리, ML 실험 또는 AI 기능을 구현할 수 있어요.
• Transformer와 LLM의 기본적인 동작 원리를 이해하고, PyTorch, Hugging Face 등 ML Framework를 활용할 수 있어요.
• ReAct, Tool-using Agent 또는 Multi-Agent System을 직접 설계하고 개발해 본 경험이 있어요.
• 논문이나 기술 자료의 아이디어를 이해하고 실행 가능한 코드와 실험으로 옮길 수 있어요.
• 가설, 평가 기준과 비교 대상을 세우고 실험 결과를 근거로 다음 행동을 결정할 수 있어요.
• 자신이 작성한 코드를 테스트하고, 동료가 이해하고 재사용할 수 있는 형태로 개선하려고 노력해요.
• 익숙하지 않은 문제를 만났을 때 필요한 내용을 학습하고 동료와 협업하여 끝까지 해결할 수 있어요.
• 자신의 실험 과정과 기술적 판단을 문서와 말로 명확하게 설명할 수 있어요.

기술 스택 • 툴

태그

마감일

상시채용

근무지역

서울 영등포구 여의대방로69길 23, 10층 (07333)
본 채용정보는 원티드랩의 동의없이 무단전재, 재배포, 재가공할 수 없으며, 구직활동 이외의 용도로 사용할 수 없습니다.
본 채용 정보는 에서 제공한 자료를 바탕으로 원티드랩에서 표현을 수정하고 이의 배열 및 구성을 편집하여 완성한 원티드랩의 저작자산이자 영업자산입니다. 본 정보 및 데이터베이스의 일부 내지는 전부에 대하여 원티드랩의 동의 없이 무단전재 또는 재배포, 재가공 및 크롤링할 수 없으며, 게재된 채용기업의 정보는 구직자의 구직활동 이외의 용도로 사용될 수 없습니다. 원티드랩은 에서 게재한 자료에 대한 오류나 그 밖에 원티드랩이 가공하지 않은 정보의 내용상 문제에 대하여 어떠한 보장도 하지 않으며, 사용자가 이를 신뢰하여 취한 조치에 대해 책임을 지지 않습니다.
<저작권자 (주)원티드랩. 무단전재-재배포금지>