고객사 개요
고객사는 미국의 선도적인 기술 대학에 소속된 연구 그룹입니다. 이들은 macOS, Windows, Linux 플랫폼에서 상호작용하고 운영할 수 있는 컴퓨터 사용 에이전트(CUA) 형태의 AI 에이전트를 개발 중입니다. 현재 단계에서는 에이전트가 요청을 분석하여 목표로 변환하고, 그에 따른 작업을 실행할 수 있습니다.
비즈니스 과제
- 안정적이고 일반화 가능한 CUA 학습을 위해 매우 크고 고품질의 궤적(trajectory) 데이터셋이 필요합니다.
- 복잡하고 상태를 지닌 UI 컴포넌트(예: 선택 상자, 편집 가능한 필드, 모달 등)가 흔하여 과제가 다양하고 점점 복잡해져야 합니다.
- 모델 발전에 따라 과제가 다양하고 난이도가 상승해야 합니다.
- 거의 완벽한 단계별 정확성과 엄격한 품질 관리가 요구되는데 단 한 번의 잘못된 단계 실행도 전체 결과를 무효화할 수 있습니다.
- macOS, Windows, Linux 세 가지 운영체제를 모두 포괄해야 하며, OS별 UI 및 행위 차이로 인한 실패를 방지해야 합니다.
- 비용 효율성을 유지하면서 확장 가능하고 고도의 숙련된 리소스 투입이 필요합니다.
- 진행 상황을 추적하고 학습을 평가 기준과 정렬하기 위해 신뢰할 수 있는 벤치마크가 요구됩니다.
프로젝트 정보
궤적 수집 및 기록, 작업 작성 및 시나리오 설계, 멀티 OS 일반화, OSWorld 기반 환경 및 평가 도구, 벤치마크 구축 및 프로토콜, AI 평가, 수정된 사고 방식 적용, 데이터 거버넌스 관리
솔루션

- 경험이 풍부한 운영자들과 함께 표준화된 녹화 및 수정 파이프라인을 운영하여 높은 처리량을 달성합니다.
- 모델이 실패하는 지점과 어려운 UI 상호작용을 선제적으로 타겟팅하는 시나리오를 설계하여 커버리지를 향상시킵니다.
- 모델 로드맵에 맞춰 빠른 과제 갱신과 난이도 상승을 지원하는 유연한 과제 생성 파이프라인을 유지합니다.
- 명확한 평가 기준과 다층 검사(동료 검토, 표본 점검, 골드 스탠더드) 및 성과 지표(성공률, 리드 타임, 자체 회복력) 추적 기능을 갖춘 엔드투엔드 품질 관리(QA)를 구현합니다.
- 세 가지 플랫폼 간 가이드라인을 표준화하고 과제를 실행하여 배포 환경을 반영하고 운영체제별 오류를 줄입니다.
- 빠른 교육, 성과 측정, 경쟁력 있는 비용을 갖춘 검증된 아웃소싱 모델을 통해 용량을 확대합니다.
- 난이도와 판별력을 균형 있게 조절하고 실제 작업 흐름을 반영하며, 반복 개선에 필요한 실행 가능한 신호를 제공하는 벤치마크 과제 세트를 구축합니다.
주요 결과






