같은 답안을 다섯 번 채점하면
서로 다른 답안 6개를 각각 5번 채점했더니 총점 표준편차가 평균 1.78점, 가장 큰 답안이 3.24점이었다. 판정이 한 번이라도 바뀐 채점 항목은 105개 중 13개였다. AI 채점 점수를 볼 때 몇 점 차이까지를 같은 점수로 봐야 하는지에 대한 스물두줄의 실측입니다.
잰 값
| 답안 | 평균 | 표준편차 | 최고−최저 | 판정 바뀐 항목 |
|---|---|---|---|---|
| A | 17.6 | 2.04 | 5.0 | 3/24 |
| B | 50.2 | 3.24 | 8.6 | 4/17 |
| C | 72.2 | 1.70 | 3.8 | 2/16 |
| D | 82.0 | 2.41 | 4.4 | 1/16 |
| E | 86.1 | 1.31 | 2.7 | 3/15 |
| F | 97.0 | 0.00 | 0.0 | 0/17 |
어떻게 읽나
같은 답안이 채점마다 몇 점씩 오갑니다. 스물두줄은 표준편차 3점 이하를 기준으로 삼습니다. 6개 중 1개가 이 기준을 넘었습니다. 그러니 한 번의 점수보다 여러 답안에 걸친 흐름을 보는 편이 맞고, 2~3점 차이는 같은 실력으로 읽는 것이 안전합니다. 점수가 흔들리는 곳은 대개 판정 경계에 걸린 항목 한두 개입니다 — '부분' 과 '충족' 사이를 오가면 그 항목 배점만큼 총점이 움직입니다.
흔들림을 줄이는 방법
모델에게 총점을 묻지 않고, 채점 항목마다 충족, 부분, 미흡, 누락 넷 중 하나만 고르게 합니다. 점수는 정해진 산식이 계산합니다(채점 방식). 판정이 바뀐 항목이 무엇인지 보이므로, 흔들린 이유를 항목 단위로 찾을 수 있습니다. 채점 모델이나 프롬프트를 바꾸면 이 측정을 다시 하고, 점수 기록에 어떤 모델로 채점했는지 남깁니다.
한계
답안 6개, 각 5회라는 작은 측정입니다. 실제 채점위원 점수와 얼마나 맞는지는 아직 재지 않았습니다. 이 값은 '같은 채점기가 얼마나 일관되나' 이지 '얼마나 정확하나' 가 아닙니다.
인용할 때
스물두줄, 「같은 답안을 다섯 번 채점하면」, https://gisulsa.teamcat.app/lab/grading-stability/ (2026-10-05 측정)