스물두줄

총점을 모델에게 바로 물으면

같은 답안 6개를 '항목 판정 + 산식' 과 '총점 바로 묻기' 로 5번씩 채점했다. 흔들림은 비슷했지만(표준편차 평균 1.78점 대 1.92점), 총점을 바로 물으면 점수가 양 끝으로 벌어졌다 — 최대 +15.0점, -15.4점.

잰 값

답안산식 평균σ총점 평균σ차이
A 정보관리 제126회 4-217.62.042.22.17-15.4
B 토목구조 제139회 1-150.23.2446.84.02-3.4
C 정보관리 제140회 4-672.21.7087.21.30+15.0
D 정보관리 제140회 2-282.02.4184.21.48+2.2
E 정보관리 제140회 1-1386.11.3193.01.22+6.9
F 정보관리 제140회 3-397.00.0098.61.34+1.6

측정 2026-10-05 · 모델 openai/gpt-6-luna · 답안당 방식별 5회. 두 방식 모두 같은 재료(문제·모범답안·채점 항목·답안·분량)를 받았고, 다른 것은 '항목마다 판정' 과 '100점 만점 총점' 이라는 질문뿐입니다. 답안은 시험용 계정의 답안입니다.

무엇이 달랐나

흔들림은 비슷했습니다. 총점을 바로 물어도 같은 답안의 점수가 크게 더 흔들리지는 않았습니다. 우리가 이 방식을 쓰지 않는 이유로 '재현성' 을 들어 왔는데, 이번 측정으로는 뚜렷하지 않았습니다.

점수대가 달랐습니다. 가장 약한 답안(A)은 총점 방식이 -15.4점, 중상위 답안(C)은 +15.0점이었습니다. 잘 쓴 답안은 더 높게, 약한 답안은 더 낮게 — 인상으로 매기는 쪽이 양 끝으로 벌어졌습니다. 총점 방식은 4번 97점을 넘겼습니다.

그래서 스물두줄은

모델에게는 항목별 판정만 받고 점수는 산식이 냅니다(판정 계수 충족 1 · 부분 0.6 · 미흡 0.3 · 누락 0 · 축 배점 내용 55 · 구성 15 · 도식·표 15 · 사례·동향 10 · 분량 5 · 상한 97점). 이유는 셋입니다. 어느 항목에서 몇 점이 깎였는지 답안 쓴 사람에게 보여 줄 수 있고, 같은 판정이면 언제나 같은 점수가 나오며, 점수가 인상에 따라 양 끝으로 벌어지지 않습니다. 흔들림 자체는 같은 답안을 다섯 번 채점하면에 있습니다.

한계

답안 6개의 작은 비교이고, 어느 쪽이 실제 채점위원 점수에 더 가까운지는 재지 않았습니다.

인용할 때

아래처럼 출처를 달아 주세요. 다시 재면 숫자가 바뀌므로 측정일을 함께 적습니다.

스물두줄, 「총점을 모델에게 바로 물으면」, https://gisulsa.teamcat.app/lab/total-score/ (2026-10-05 측정)

측정 2026-10-05 · 운영 팀캣