포지션 상세
클레온은 AI 기반 디지털 휴먼 기술과 서비스를 실제 서비스 현장에 적용하고 있습니다. 디지털 휴먼이 더 자연스럽게 듣고(ASR), 생각하고(LLM), 말할 수 있도록(TTS) 하는 실시간 오디오 인터랙션 엔진을 함께 고도화할 TTS/ASR 전문가를 모십니다.
클레온 홈페이지에서 디지털 휴먼을 직접 경험해보세요!
https://www.klleon.io
음성 인식 및 전처리 (ASR)
• 실시간 ASR 파이프라인 구축 및 최적화
• VAD(Voice Activity Detection), Noise Reduction 등 음성 전처리 로직 개선
• 사용자 발화 종료 시점(EoT) 및 화자 분리(Diarization)·식별 기술을 통한 대화 맥락 개선
음성 합성 및 후처리 (TTS)
• 실시간/고품질 TTS 파이프라인 구축 및 음성 합성 모델 고도화
• 디지털 휴먼의 페르소나에 맞춘 감정, 억양(Prosody) 제어 및 Voice Cloning 기술 적용
• 스트리밍 방식의 TTS 오디오 출력 최적화
인터랙션 루프 최적화
• ASR 결과를 Claude, GPT 등 LLM과 연동하고, 이를 다시 TTS로 연결하는 시스템 설계
• ASR – LLM – TTS – 디지털 휴먼 렌더링으로 이어지는 전체 인터랙션 루프의 지연 시간(Latency) 최소화 및 오디오 품질 개선
• Python 기반 음성 처리(Audio Processing) 및 머신러닝 파이프라인 개발 경험이 필수적이신 분
• ASR(STT) 또는 TTS(음성합성) 중 최소 한 가지 분야에 깊은 전문성이 있으며, 두 기술의 연동에 대한 이해도가 높으신 분
• PyTorch 기반 모델 서빙 및 추론 최적화(TensorRT, ONNX 등) 경험이 있으신 분
• 음성 입출력이 디지털 휴먼의 반응(애니메이션, 렌더링)으로 이어지는 전체 실시간 인터랙션 흐름에 관심이 많으신 분
클레온 홈페이지에서 디지털 휴먼을 직접 경험해보세요!
https://www.klleon.io
주요업무
디지털 휴먼의 '청각'과 '목소리'를 담당하는 ASR 및 TTS 파이프라인의 전반적인 연구 개발 및 최적화를 담당합니다.음성 인식 및 전처리 (ASR)
• 실시간 ASR 파이프라인 구축 및 최적화
• VAD(Voice Activity Detection), Noise Reduction 등 음성 전처리 로직 개선
• 사용자 발화 종료 시점(EoT) 및 화자 분리(Diarization)·식별 기술을 통한 대화 맥락 개선
음성 합성 및 후처리 (TTS)
• 실시간/고품질 TTS 파이프라인 구축 및 음성 합성 모델 고도화
• 디지털 휴먼의 페르소나에 맞춘 감정, 억양(Prosody) 제어 및 Voice Cloning 기술 적용
• 스트리밍 방식의 TTS 오디오 출력 최적화
인터랙션 루프 최적화
• ASR 결과를 Claude, GPT 등 LLM과 연동하고, 이를 다시 TTS로 연결하는 시스템 설계
• ASR – LLM – TTS – 디지털 휴먼 렌더링으로 이어지는 전체 인터랙션 루프의 지연 시간(Latency) 최소화 및 오디오 품질 개선
자격요건
• 딥러닝 관련 경력 2년 이상이 있으신 분 (석사 이상 학위는 경력 인정 가능)• Python 기반 음성 처리(Audio Processing) 및 머신러닝 파이프라인 개발 경험이 필수적이신 분
• ASR(STT) 또는 TTS(음성합성) 중 최소 한 가지 분야에 깊은 전문성이 있으며, 두 기술의 연동에 대한 이해도가 높으신 분
• PyTorch 기반 모델 서빙 및 추론 최적화(TensorRT, ONNX 등) 경험이 있으신 분
• 음성 입출력이 디지털 휴먼의 반응(애니메이션, 렌더링)으로 이어지는 전체 실시간 인터랙션 흐름에 관심이 많으신 분











