고객 개요
미국에서 온 고객사는 실제 웹 브라우징 상호작용 데이터를 수집하여 AI 에이전트의 성능 평가를 원했습니다. 본 프로젝트는 실제 웹사이트 탐색 과정에서 단계별 추론, 행동 논리, 스크린샷 정확도, 최종 답변 품질을 검증하는 데 중점을 둡니다.
비즈니스 과제
QA 피드백 지연: 생산 완료 후 3주가 지나서야 QA 리뷰가 시작되어 대규모 소급 수정과 빠른 데이터 조정이 필요했습니다.
빈번한 가이드라인 업데이트: 팝업, 백스페이스 사용, 복사–붙여넣기 제한 등 복잡한 상호작용 규칙이 실시간으로 자주 업데이트되었습니다.
고정밀 기술 제약: WebOlmo 전용 실행 방식에 엄격히 준수하며, 문자 단위 입력과 스크린샷 정확도를 촉박한 일정 하에 보장해야 했습니다.
프로젝트 정보
예상 결과물: Web Navigation AI

솔루션
- 가이드라인 변경 효과적인 관리
- 골든 가이드 업데이트를 실시간으로 추적하고 적용
- 업데이트 후 신속한 재교육 실시
- 팀의 일관성 유지를 위한 일일 보정 세션 운영
- 명확한 브라우징 프로세스 구축
- 구조화된 WebOlmo 실행 체크리스트 작성
- 문자 단위 입력 및 스크린샷 정확도 엄격 관리
- AI 논리 및 최종 답변 검증을 위한 추론 템플릿 활용
- 품질 및 일정 준수 유지
- QA 시작 시 전담 수정팀 구성
- 위험도 높은 배치에 다층 리뷰 적용
- 납품 속도 보호를 위해 생산팀과 수정팀 분리 운영
사용 기술

주요 결과






