Code
대부분 syntax 문제가 아니라 socket 처리, return 형태, random 처리, 반복·분기 같은 구현 선택 차이였다.
바뀐 경우는 있었다. 하지만 대부분은 특정 모델이나 특정 생성 회차에서만 나타났다. 조건 효과가 전혀 없다는 뜻도, 특정 조건이 항상 좋다는 뜻도 아니다. 반복해서 같은 패턴이 나온 사례는 많지 않았다.
같은 샘플이 여러 모델이나 Gemini 반복에서 다시 민감하게 나타날 수 있다. 그래서 관측 횟수와 고유 샘플 수를 따로 셌다.
한 모델의 한 실행에서 EN·KO·MIX1·MIX2·MIX3 정답이 섞여 나온 횟수다.
중복을 합친 실제 문제 수다. strict-primary 255개 중 어느 모델·회차에서든 조건 차이가 한 번 이상 있었다.
막대는 고유 샘플 수다. 오른쪽 설명은 184개 instance에서 관찰한 첫 번째 구조적 오류 신호를 합친 것이다.
각 셀은 그 실행에서 다섯 조건의 정답·오답이 갈린 샘플 비율이다. 태스크마다 순서가 달라진다.
| 실행 | Code | SQL | Finance |
|---|---|---|---|
| Gemini run 1 | 12.6% | 11.1% | 2.9% |
| Gemini run 2 | 16.1% | 9.5% | 1.0% |
| Gemini run 3 | 10.3% | 11.1% | 1.9% |
| Qwen3 8B AWQ | 27.6% | 30.2% | 20.0% |
| EXAONE 3.5 2.4B | 17.2% | 19.0% | 31.4% |
아래 분류는 저장된 output과 gold payload의 첫 번째 보이는 구조 차이다. 모델 내부의 인과를 직접 측정한 것은 아니다.
대부분 syntax 문제가 아니라 socket 처리, return 형태, random 처리, 반복·분기 같은 구현 선택 차이였다.
영어 technical term이 들어오면 비슷한 이름의 다른 column이나 table을 고르는 사례가 반복됐다.
대부분 실행은 됐지만 다른 숫자, 연산자, 기간, 단위를 사용해 값이 달라졌다. 알려진 전처리 결함은 1건이었다.
버튼을 눌러 네 사례를 비교할 수 있다. 첫 세 사례는 반복 또는 모델 간 확인 사례이고, 마지막은 알려진 전처리 결함이다.
한 조건만 맞은 67개 instance 중 EN 단독 정답이 34개로 가장 많았다. 반대로 네 조건이 맞고 하나만 틀린 42개 instance에서는 EN 단독 오답도 14개로 가장 많았다.
Gemini에서 한 번이라도 민감했던 30개 중 세 회차 모두 민감한 것은 10개였다. 동일한 5조건 패턴까지 세 번 반복된 것은 3개뿐이다.
세 모델에서 모두 조건별 정답이 갈린 문제는 116개 중 5개였다. 두 모델씩 비교해도 겹치는 문제가 적었다.
BIRD 1110은 Gemini 세 회차와 Qwen에서 MIX2의 rating이 숫자 column을 고르게 하면서 같은 방식으로 실패했다. 이렇게 반복된 사례는 한 번만 달라진 사례와 나눠서 봐야 한다.
태스크, 모델·회차, pass/fail profile, 구조적 오류 신호를 모두 확인할 수 있다. profile 순서는 EN·KO·MIX1·MIX2·MIX3이며 1은 정답, 0은 오답이다.
불러오는 중…
| Task | ID | Model / run profile | 오류 신호 | 원문 요약 |
|---|