총점을 모델에게 바로 물으면
같은 답안 6개를 '항목 판정 + 산식' 과 '총점 바로 묻기' 로 5번씩 채점했다. 흔들림은 비슷했지만(표준편차 평균 1.78점 대 1.92점), 총점을 바로 물으면 점수가 양 끝으로 벌어졌다 — 최대 +15.0점, -15.4점.
잰 값
| 답안 | 산식 평균 | σ | 총점 평균 | σ | 차이 |
|---|---|---|---|---|---|
| A | 17.6 | 2.04 | 2.2 | 2.17 | -15.4 |
| B | 50.2 | 3.24 | 46.8 | 4.02 | -3.4 |
| C | 72.2 | 1.70 | 87.2 | 1.30 | +15.0 |
| D | 82.0 | 2.41 | 84.2 | 1.48 | +2.2 |
| E | 86.1 | 1.31 | 93.0 | 1.22 | +6.9 |
| F | 97.0 | 0.00 | 98.6 | 1.34 | +1.6 |
무엇이 달랐나
흔들림은 비슷했습니다. 총점을 바로 물어도 같은 답안의 점수가 크게 더 흔들리지는 않았습니다. 우리가 이 방식을 쓰지 않는 이유로 '재현성' 을 들어 왔는데, 이번 측정으로는 뚜렷하지 않았습니다.
점수대가 달랐습니다. 가장 약한 답안(A)은 총점 방식이 -15.4점, 중상위 답안(C)은 +15.0점이었습니다. 잘 쓴 답안은 더 높게, 약한 답안은 더 낮게 — 인상으로 매기는 쪽이 양 끝으로 벌어졌습니다. 총점 방식은 4번 97점을 넘겼습니다.
그래서 스물두줄은
모델에게는 항목별 판정만 받고 점수는 산식이 냅니다(판정 계수 충족 1 · 부분 0.6 · 미흡 0.3 · 누락 0 · 축 배점 내용 55 · 구성 15 · 도식·표 15 · 사례·동향 10 · 분량 5 · 상한 97점). 이유는 셋입니다. 어느 항목에서 몇 점이 깎였는지 답안 쓴 사람에게 보여 줄 수 있고, 같은 판정이면 언제나 같은 점수가 나오며, 점수가 인상에 따라 양 끝으로 벌어지지 않습니다. 흔들림 자체는 같은 답안을 다섯 번 채점하면에 있습니다.
한계
답안 6개의 작은 비교이고, 어느 쪽이 실제 채점위원 점수에 더 가까운지는 재지 않았습니다.
인용할 때
스물두줄, 「총점을 모델에게 바로 물으면」, https://gisulsa.teamcat.app/lab/total-score/ (2026-10-05 측정)