고객사 개요
고객사는 중국에 본사를 둔 선도적인 다국적 기술 기업으로 여러 프로그래밍 언어와 복잡한 코드베이스에 걸친 장기 소프트웨어 엔지니어링 과제를 해결하도록 설계된 AI 코딩 에이전트를 개발하고 있습니다.
비즈니스 과제
- 안정적인 학습과 강력한 일반화 기능을 보장하기 위해 대규모 고품질 궤적 데이터가 필요합니다.
- 과제는 다양하며 점진적으로 난이도가 상승해야 하며, 모델 로드맵과 일치해야 합니다(난이도 단계적 상승).
- 거의 완벽한 단계별 정확성이 필수이며, 엄격한 품질 관리에서 단 한 번의 잘못된 단계도 전체 궤적을 무효화할 수 있습니다.
- 프로그래밍 언어와 요청 유형(버그 수정, 환경 문제, 기능 개발 등)에 걸쳐 폭넓은 커버리지가 요구됩니다.
- 경험 많은 개발자가 필요하며, 다년간의 실무 개발 및 프로젝트 유지보수 경험이 요구됩니다.
- 시간이 지남에 따른 진행 상황을 추적하고 훈련이 평가 목표에 맞도록 안정적이고 일관된 벤치마크 및 점수 매기기 방식이 필요합니다.
프로젝트 정보
장기 궤적 수집 및 기록, 품질 보증(QA) 프레임워크 설계 및 실행, 과제 및 시나리오 작성, 다국어 코드 커버리지, AI 에이전트 평가 및 진행 상황 추적
솔루션
- 표준화된 생산 파이프라인 운영: 과제 생성 → 실행 → 수정 → 자동 품질 검사(QA) → 인간 QA를 통해 처리량을 높이고 오류를 줄입니다.
- 로드맵에 맞춘 과제 생성: 빠른 갱신 주기, 난이도 조절, 단계적 도메인 확장으로 학습 단계를 관리합니다.
- 명확한 평가 기준에 따른 end-to-end QA: 동료 검토, 샘플 검사, 골드 스탠더드 과제 등 다층 검사를 실시하며, 통과율, 수정 거리, 수정 시간, 자기 회복력 등의 지표를 추적합니다.
- 아웃소싱을 통한 확장 가능한 전달: 빠른 온보딩, 주기적인 성과 측정, 숙련도 레벨링을 통해 비용 대비 품질을 최적화합니다.
- 궤적 품질 관리: 추론 경로 검증, 도구 사용 확인, 재현성 검사를 수행합니다.
- 평가 준비된 데이터셋 구축: 에이전트 벤치마크와 호환되는 표준화된 형식 제공합니다.
- 지속적 개선 반복: 평가 결과를 기반으로 과제 갱신과 QA 업데이트를 진행합니다.
주요 결과






