스물두줄

같은 답안을 다섯 번 채점하면

서로 다른 답안 6개를 각각 5번 채점했더니 총점 표준편차가 평균 1.78점, 가장 큰 답안이 3.24점이었다. 판정이 한 번이라도 바뀐 채점 항목은 105개 중 13개였다. AI 채점 점수를 볼 때 몇 점 차이까지를 같은 점수로 봐야 하는지에 대한 스물두줄의 실측입니다.

잰 값

답안평균표준편차최고−최저판정 바뀐 항목
A 정보관리 제126회 4-217.62.045.03/24
B 토목구조 제139회 1-150.23.248.64/17
C 정보관리 제140회 4-672.21.703.82/16
D 정보관리 제140회 2-282.02.414.41/16
E 정보관리 제140회 1-1386.11.312.73/15
F 정보관리 제140회 3-397.00.000.00/17

측정 2026-10-05 · 모델 openai/gpt-6-luna · 채점 프롬프트 grade-v2 · 산식 score-2026-09-26 · 답안당 5회 · 채점 1회 평균 34초, $0.0022. 답안은 시험용 계정의 키보드 답안이며 실제 학습자 답안이 아닙니다.

어떻게 읽나

같은 답안이 채점마다 몇 점씩 오갑니다. 스물두줄은 표준편차 3점 이하를 기준으로 삼습니다. 6개 중 1개가 이 기준을 넘었습니다. 그러니 한 번의 점수보다 여러 답안에 걸친 흐름을 보는 편이 맞고, 2~3점 차이는 같은 실력으로 읽는 것이 안전합니다. 점수가 흔들리는 곳은 대개 판정 경계에 걸린 항목 한두 개입니다 — '부분' 과 '충족' 사이를 오가면 그 항목 배점만큼 총점이 움직입니다.

흔들림을 줄이는 방법

모델에게 총점을 묻지 않고, 채점 항목마다 충족, 부분, 미흡, 누락 넷 중 하나만 고르게 합니다. 점수는 정해진 산식이 계산합니다(채점 방식). 판정이 바뀐 항목이 무엇인지 보이므로, 흔들린 이유를 항목 단위로 찾을 수 있습니다. 채점 모델이나 프롬프트를 바꾸면 이 측정을 다시 하고, 점수 기록에 어떤 모델로 채점했는지 남깁니다.

한계

답안 6개, 각 5회라는 작은 측정입니다. 실제 채점위원 점수와 얼마나 맞는지는 아직 재지 않았습니다. 이 값은 '같은 채점기가 얼마나 일관되나' 이지 '얼마나 정확하나' 가 아닙니다.

인용할 때

아래처럼 출처를 달아 주세요. 다시 재면 숫자가 바뀌므로 측정일을 함께 적습니다.

스물두줄, 「같은 답안을 다섯 번 채점하면」, https://gisulsa.teamcat.app/lab/grading-stability/ (2026-10-05 측정)

측정 2026-10-05 · 운영 팀캣