Condition-sensitive sample audit · 2026.08.31

말을 바꾸면
답도 바뀌었을까?

바뀐 경우는 있었다. 하지만 대부분은 특정 모델이나 특정 생성 회차에서만 나타났다. 조건 효과가 전혀 없다는 뜻도, 특정 조건이 항상 좋다는 뜻도 아니다. 반복해서 같은 패턴이 나온 사례는 많지 않았다.

116한 번이라도 조건별 정답이 달랐던 고유 샘플

Gemini를 세 번 돌렸을 때

30어느 회차에서든 조건 민감
10세 회차 모두 조건 민감
3정답·오답 패턴까지 세 번 동일

모델을 바꿔서 비교했을 때

116Gemini·Qwen·EXAONE 전체 합집합
5세 모델 계열 모두에서 조건 민감
1알려진 전처리 결함과 겹친 샘플
01 · Count

184개와 116개는 서로 다른 숫자다

같은 샘플이 여러 모델이나 Gemini 반복에서 다시 민감하게 나타날 수 있다. 그래서 관측 횟수와 고유 샘플 수를 따로 셌다.

184

model-run instance

한 모델의 한 실행에서 EN·KO·MIX1·MIX2·MIX3 정답이 섞여 나온 횟수다.

116

unique sample

중복을 합친 실제 문제 수다. strict-primary 255개 중 어느 모델·회차에서든 조건 차이가 한 번 이상 있었다.

02 · Tasks

민감한 문제의 모양은 태스크마다 달랐다

막대는 고유 샘플 수다. 오른쪽 설명은 184개 instance에서 관찰한 첫 번째 구조적 오류 신호를 합친 것이다.

Code

37

73 instance
예외·edge case 40 / algorithm·control flow 33

Text-to-SQL

27

51 instance
schema·table·join 34 / query logic·aggregation·output 17

Finance

52

60 instance
formula·input·scale 52 / execution·format 7 / preprocessing 1

03 · Model × task

작은 모델일수록 항상 더 민감한 것도 아니었다

각 셀은 그 실행에서 다섯 조건의 정답·오답이 갈린 샘플 비율이다. 태스크마다 순서가 달라진다.

실행CodeSQLFinance
Gemini run 112.6%11.1%2.9%
Gemini run 216.1%9.5%1.0%
Gemini run 310.3%11.1%1.9%
Qwen3 8B AWQ27.6%30.2%20.0%
EXAONE 3.5 2.4B17.2%19.0%31.4%
분모: Code 87 · SQL 63 · Finance 105이 비율은 성능 점수가 아니라 “조건별 결과가 갈린 비율”이다.
04 · Error fingerprints

조건은 모델이 선택한 해결 경로를 바꿨다

아래 분류는 저장된 output과 gold payload의 첫 번째 보이는 구조 차이다. 모델 내부의 인과를 직접 측정한 것은 아니다.

Code

예외·edge case40
algorithm·control flow33

대부분 syntax 문제가 아니라 socket 처리, return 형태, random 처리, 반복·분기 같은 구현 선택 차이였다.

Text-to-SQL

schema·table·join34
query logic·output17

영어 technical term이 들어오면 비슷한 이름의 다른 column이나 table을 고르는 사례가 반복됐다.

Finance

formula·input·scale52
execution·format7

대부분 실행은 됐지만 다른 숫자, 연산자, 기간, 단위를 사용해 값이 달라졌다. 알려진 전처리 결함은 1건이었다.

05 · Real cases

반복해서 확인된 사례를 직접 보면 더 분명하다

버튼을 눌러 네 사례를 비교할 수 있다. 첫 세 사례는 반복 또는 모델 간 확인 사례이고, 마지막은 알려진 전처리 결함이다.

06 · What we learned

지금 말할 수 있는 것과 아직 말할 수 없는 것

EN은 자주 유일한 정답이었지만, 항상 유리하지 않았다

한 조건만 맞은 67개 instance 중 EN 단독 정답이 34개로 가장 많았다. 반대로 네 조건이 맞고 하나만 틀린 42개 instance에서는 EN 단독 오답도 14개로 가장 많았다.

반복되지 않은 flip은 조건 효과와 생성 변동을 분리하기 어렵다

Gemini에서 한 번이라도 민감했던 30개 중 세 회차 모두 민감한 것은 10개였다. 동일한 5조건 패턴까지 세 번 반복된 것은 3개뿐이다.

모델마다 흔들린 문제가 달랐다

세 모델에서 모두 조건별 정답이 갈린 문제는 116개 중 5개였다. 두 모델씩 비교해도 겹치는 문제가 적었다.

표현 하나의 차이가 반복된 사례는 SQL에서 나왔다

BIRD 1110은 Gemini 세 회차와 Qwen에서 MIX2의 rating이 숫자 column을 고르게 하면서 같은 방식으로 실패했다. 이렇게 반복된 사례는 한 번만 달라진 사례와 나눠서 봐야 한다.

07 · Full audit

116개 전수 목록

태스크, 모델·회차, pass/fail profile, 구조적 오류 신호를 모두 확인할 수 있다. profile 순서는 EN·KO·MIX1·MIX2·MIX3이며 1은 정답, 0은 오답이다.

전수 목록 열기

불러오는 중…

TaskIDModel / run profile오류 신호원문 요약