# 로컬 모델 동일 업무 비교

평가 시작: 2026-09-13 19:21 KST. 실행별 원본: data/processed/promotions/agent-benchmark/20260913T102134Z/

역할 분업을 전제로 모델을 선정하지 않는다. 각 모델이 독립된 새 브라우저에서 같은 상품 페이지를 확인하고, 화면을 캡처하고, 추가 탐색 여부를 결정하고, 동일 스키마로 가격·포장·프로모션을 추출한다. 브라우저는 모델의 제한된 동작을 실행하는 도구다.

- 동일 판매처: 호주 Lila Beauty, 독일 dm, 캐나다 Well.ca
- 동일 실행 환경: 로그아웃, 1440×1100 화면, 같은 장비의 네트워크, 현지 시간대
- 탐색 결정 최대 2회, 모델 호출당 90초 제한, 최대 출력 1,800토큰
- 허용 동작: 캡처, 위/아래 스크롤, 상품 설명 펼치기, 종료. 로그인·구매·장바구니 변경·접근 차단 해제는 이 시험 범위 밖
- 모델 간 답변 공유 없음. 각 모델은 동일 판매처 3곳을 순서대로 수행. 전체 동시 모델 수는 2개
- 원본 화면·본문·모델 답변·동작·시간·오류 보관. 평가 캡처는 운영 가격 이력에 자동 반영하지 않음

## 후보

| 모델 | 입력 | 상태 |
|---|---|---|
| Gemma 4 26B-A4B | 화면+본문 | 시험 |
| Qwen 3.6 35B-A3B | 화면+본문 | 시험 |
| Qwen 3.8 27B | 화면+본문 | 시험 |
| DeepSeek V4 Flash CPU | 본문·브라우저 도구 | 시험 · 현재 연결은 이미지 입력 없음 |
| EXAONE 4.5 33B | 화면+본문 | 프로젝트 non_commercial 제한으로 호출 제외 |

DeepSeek의 캡처 도구 실행과 이미지 내용 판독은 구분한다. 이미지 입력이 없는 결과를 비전 성공률로 계산하지 않는다. Gemma 연결 별칭은 gemma-4-31b-gpu지만 실제 가중치는 26B-A4B이다.

## 선정 기준

1. 캡처 확보율과 추출 성공률을 별도로 집계한다.
2. 현재 화면과 대조한 가격·통화·매수, 프로모션 유형·조건, 판매자·재고를 평가한다. 과거 가격과의 일치를 정답으로 쓰지 않는다.
3. 숫자 근거 검증 통과만으로 정확 판정을 내리지 않는다. 다른 옵션을 행사로 잘못 읽거나 쿠폰·포인트 조건을 빠뜨리면 오류로 기록한다.
4. 정상 페이지·국가/옵션 선택·팝업·다국어·마켓플레이스 등 여러 조건을 추가 시험한다. 이번 3곳 1회 시험만으로 최종 모델을 선정하거나 학습 정답을 자동 생성하지 않는다.
5. 새 모델을 메모리에 올리지 않고 상주 모델을 사용한다. 가격·행사 검토의 프론티어 확인을 유지한다. Claude API 호출 없음.

## 1차 결과

완료: 2026-09-13T10:28:45.997364+00:00 (UTC). 세 판매처 1회.

| 모델 | 표시 가격·매수 일치 | 평균 총 시간 | 관찰 사항 |
|---|---|---|---|
| Gemma 4 26B-A4B | 3/3 | 16.2초 | 첫 구매 LILA10 쿠폰 조건 누락 / 원답에서 선택하지 않은 4매 포장을 수량 행사로 해석 |
| Qwen 3.6 35B-A3B | 3/3 | 16.6초 | 첫 구매 LILA10 쿠폰 조건 누락 / K Beauty 구매 포인트 조건 누락 |
| Qwen 3.8 27B | 3/3 | 25.6초 | 표시 쿠폰·포인트 조건 기록. 이번 확인 범위 내 수량 행사 오판 발견 없음. |
| DeepSeek V4 Flash CPU | 2/3 | 127.2초 | 첫 구매 LILA10 쿠폰 조건 누락 / K Beauty 구매 포인트 조건 누락 / 실패: de-dm |

Qwen 3.8을 후속 시험 우선 후보로 기록한다. 이 결과는 광범위한 정확도 보증이나 최종 운영 교체 판정이 아니다. EXAONE은 사용 제한으로 시험하지 않았으며, DeepSeek CPU 결과는 비전 평가에 포함하지 않는다. 신규 자료나 학습 정답으로 자동 반영하지 않았다.
