수능 등업 트레이닝統計

2005~2026학년도 수능 실제 정답 배열 · 마킹 전략 훈련

정답 배열


번호별 분포 · 세로선 = 기대치 N/5

15개년 종합 — 데이터가 말해주는 것

    수학 단답형 연구 — 세 자리 이하 자연수 마킹

    수학 단답형(현행 16~22번·29~30번, 구 22~30번)의 정답은 출제 형식상 세 자리 이하의 자연수(1~999)로 출제됩니다. 22개 학년도 수능의 단답형 정답을 전부 모아 값의 분포, 치우침의 학술적 원인, 그리고 "찍어야 한다면"의 기대치를 분석했습니다.


    값의 구간 분포

    역대 최다 출현 값 TOP 10


    끝자리(일의 자리) 분포

    왜 분포가 치우치는가 — 학술적 배경

    • ① 형식 제약이 분포의 골격을 만듭니다. OMR 숫자 마킹 형식상 정답은 세 자리 이하의 자연수(1~999)로만 출제됩니다. 0·음수·분수·무리수는 애초에 답이 될 수 없습니다 — 전 표본에서 0이 한 번도 없고 최솟값이 1인 것은 발견이 아니라 형식의 귀결입니다. 유계(상한 999) 분포라는 점도 뒤 항목들의 전제가 됩니다.
    • ② 측정학: 구인 무관 변량의 최소화. 교육·심리검사 표준 (AERA·APA·NCME, Standards for Educational and Psychological Testing)은 시험이 재려는 구인(수학적 사고) 밖의 난이도 — 지저분한 산술, 마킹 부담 — 를 배제하라고 요구합니다. 출제자는 풀이가 맞으면 답이 작고 검산 가능한 수가 되도록 문제를 역설계하며, 그 결과 값이 작은 쪽으로 몰립니다(중앙값 23, 두 자리 수 73%).
    • ③ 인지과학: 작은 수의 빈도 법칙. 수의 사용 빈도는 크기가 커질수록 멱법칙으로 감소한다는 것이 Dehaene & Mehler (1992, Cognition)의 고전적 관찰입니다. 수학적으로도 조합수(nCr), 계승, 제곱수, 최소공배수 같은 "깨끗한 결과"는 작은 정수에 밀집합니다 — 역대 최빈값 12·15·10·16이 모두 전형적인 조합·산술 결과값인 이유입니다.
    • ④ 통계학: 첫째 자리의 벤포드 법칙. 여러 스케일에 걸친 계산 결과의 첫째 자리는 log₁₀(1+1/d)를 따른다는 것이 Newcomb(1881)·Benford(1938)의 법칙입니다. 아래 그림처럼 단답형 정답의 첫째 자리도 이 곡선을 따라 단조 감소하며, 1에서 이론치보다 더 가파른 것은 유계(≤999)·소수 지향 설계의 흔적입니다.
    • ⑤ 꼬리(세 자리 답)는 변별 설계입니다. 세 자리 답(약 14%)은 대부분 고난도 문항에서 나옵니다. 답 공간을 넓히면 우연 정답이 사실상 차단되어(무작위 적중 0.1%), 감점 규칙 없이도 단답형이 추측 면역 형식으로 작동합니다 — 객관식과 정반대의 설계 목표입니다.

    첫째 자리 분포 — 벤포드 법칙과의 비교

    그림 6. 단답형 정답 첫째 자리의 실측 분포(막대)와 벤포드 법칙 이론치(세로선). 막대가 세로선을 따라 단조 감소하면 법칙과 부합합니다.

    단답형 찍기 전략 — 냉정한 기대치

      단답형 간이 연습 — 0.1%의 벽 체감하기

      실제 기출 단답형 문항의 정답을 추측해 네모칸에 적어 보세요. 세 자리 이하의 자연수(1~999)입니다. 이 코너의 목적은 요행이 아니라, 단답형 찍기가 얼마나 어려운지와 분포 지식(작은 수·최빈값)이 그 벽을 아주 조금 낮춘다는 것을 몸으로 확인하는 데 있습니다.

      ※ 문항 원문은 일부러 표시하지 않습니다 — 이 코너는 풀이력이 아니라 정보가 전혀 없을 때의 추측을 시험하는 블라인드 코너이고, 이 앱의 데이터도 정답표만을 담고 있습니다. 원문이 궁금하면 평가원 기출 아카이브에서 해당 학년도 문제지를 내려받아 풀어 본 뒤 여기서 채점해 보세요.

      시도 0 적중 0 ±10 이내 0 최빈값(12) 전략 적중 0

      단답형 정답 전체 보기

      연도·과목별 실제 단답형 정답입니다. 가로로 스크롤됩니다.

      전략 연구실 — 실제 배열 백테스트

      합성 모형이 아니라 실제 수능 정답 배열에 전략을 직접 적용해 승률을 측정합니다. 각 시행마다 실제 시험지에서 무작위로 k문항을 "모르는 문제"로 가정하고, 일곱 가지 전략이 각각 몇 %나 맞히는지 수만 회 반복 측정한 뒤 95% 신뢰구간과 유의성을 함께 보고합니다.


      이론적 배경 — 이 연구실이 검증하는 문헌

      • 정답 키 균등화와 착취 가능성 — Bar-Hillel & Attali (2002), “Seek Whence”, The American Statistician. 실제 SAT 1,280문항 분석: 출제기관은 키를 무작위화하지 않고 균등화하며, 덜 나온 번호 찍기로 착취 가능함을 입증. 이 탭의 전략 리더보드는 그 전략의 수능 재현입니다.
      • 정답 위치 편향과 그 소거 — Attali & Bar-Hillel (2003), “Guess Where”, J. Educational Measurement. 출제자는 정답을 가운데 선지에 3~4:1로 숨기지만 키 균등화가 이를 거의 지웁니다 — 고정 번호 전수 조사가 이 예측을 검정합니다.
      • 인간의 의사난수와 과잉 교대 — Wagenaar (1972), “Generation of random sequences by human subjects”, Psych. Bulletin. 사람은 같은 값의 반복을 회피합니다 — 아래 연구 검증 ②에서 수능 배열로 직접 확인합니다.
      • 추측과 채점의 의사결정론 — Budescu & Bar-Hillel (1993), “To Guess or Not to Guess”, J. Educational Measurement. 감점 없는 정답 수 채점(수능 방식)에서는 빈칸 제출이 항상 열등 전략입니다.
      • 대중적 대규모 실증 — Poundstone (2014), Rock Breaks Scissors (100개 시험 2,456문항). “직전 정답 회피” 조언의 실제 크기를 리더보드의 직전·직후 회피 행이 정량화합니다.

      연구 검증 — 문헌의 예측을 수능 실제 배열로 검정 (45문항 시험 기준, 페이지 로드 시 자동 계산)

      표 1. 문헌 예측의 수능 데이터 검정. "무작위 기대"는 각 번호가 독립적으로 1/5 확률인 균등 무작위 배열 4,000개를 즉석 생성해 얻은 몬테카를로 추정치이며, 두 값의 괴리가 "사람이 만든 균등화된 배열"이라는 문헌 예측의 증거입니다.

      실험 조건

      연구 노트 · 통계 해설서

      수능 정답 배열은 무작위인가
      — 22개 학년도 336개 배열의 통계적 해부

      2005~2026학년도 홀수형 객관식 —문항 전수 · 이 페이지의 모든 수치·표·그림은 열릴 때 원자료에서 직접 계산됩니다(하드코딩 없음)

      초록. 대학수학능력시험의 정답 배열이 독립·균등 무작위열이라는 귀무가설을 네 방향에서 기각한다. (i) 주변분포는 20%에 매우 가깝지만 ①번이 유의하게 과소 출현한다 (χ²(4)=—, p=—). (ii) 시험 내부의 번호 분포는 무작위보다 훨씬 덜 흩어져 있다 — 과소산포 지수 φ=—(무작위면 1.0)로, 출제기관의 의도적 키 균등화의 직접 증거다. (iii) 균등화를 조건부로 통제한 순열검정에서도 인접 문항의 같은 번호 반복이 기대치보다 —%p 적다 — 인간의 과잉 교대 편향. (iv) 이 두 제약은 착취 가능하다: 나머지 문항을 모두 알 때 부족 번호를 고르면 적중률이 —%로, 무작위 20%의 두 배를 넘는다. 한편 국소 정보(앞뒤 ±k문항)의 기여는 ±3문항에서 소멸하며, 실전에서 쓸 수 있는 신호는 사실상 답안지 전체 카운트 하나뿐이다.

      목차

      이 탭은 '시뮬레이션' 탭의 전략 백테스트가 왜 통하는지를 통계학 언어로 설명하는 해설서입니다. 전략을 바로 쓰려면 '실전 지침' 탭으로, 수치를 직접 만지려면 '시뮬레이션' 탭으로 가세요.

      §1데이터와 표본

      무엇을 세었고 무엇을 버렸는가

      분석 단위는 배열(array) — 한 학년도·한 과목의 객관식 정답 번호를 문항 순서대로 늘어놓은 문자열이다. 예컨대 2026학년도 국어는 45문항 × 1개 배열, 사회탐구는 20문항 × 9개 배열이다. 배열을 단위로 삼는 이유는 §4에서 분명해진다 — 출제기관의 균등화는 배열 안에서 일어나기 때문이다.

      제외 규칙. ① 수학 단답형(주관식)은 1~999의 정수 답이라 5지선다 번호 통계에 들어갈 수 없어 제외한다. ② 복수정답·전원정답 처리 문항(원자료에서 0)은 "정답 번호가 하나"라는 전제가 깨지므로 제외한다. ③ 동일 학년도에 같은 과목이 중복 수록된 경우는 중복 제거한다.

      표 1. 표본 구성. 배열 길이별로 나눈 이유는 과소산포 지수가 길이에 의존하기 때문이다(§4, §10).

      컬럼: year, subject, group, exam_id, block_id, qno, ans · block_id는 문항 번호가 연속하는 구간(§5·§6·§7의 인접성 정의) · 복수정답 처리 문항은 이미 제외되어 있습니다. §12의 R 코드가 이 파일을 그대로 읽습니다.

      §2귀무모형과 검정 전략

      "무작위가 아니다"를 세 가지 서로 다른 뜻으로 나눠 묻기

      "수능 정답 배열이 무작위냐"는 질문은 사실 세 개의 다른 질문이고, 각각 다른 귀무모형이 필요하다. 이 구분을 하지 않으면 서로 상쇄되는 두 효과를 한 검정에 밀어넣게 된다.

      표 2. 세 층위의 귀무모형. M0은 흔히 쓰지만, 균등화(M1 위반)와 과잉 교대(M2 위반)를 구별하지 못한다.

      핵심은 M2(조건부 순열검정)이다. 각 배열의 번호 개수 벡터를 그대로 고정한 채 순서만 무작위로 섞으면, 균등화 효과는 귀무분포 안으로 흡수된다. 그 위에서 남는 편차는 오직 배치 순서에 관한 것이다 — 즉 "몇 개를 썼나"와 "어디에 놓았나"를 분리해서 볼 수 있다. §5~§7이 모두 이 설계를 쓴다.

      H₀ (M₂): (a₁,…,a_n) ~ Uniform( 관측된 개수벡터 c 의 모든 순열 ) 검정통계량: R = #{ i : a_i = a_{i+1} } (인접 반복 수) E[R | c] = (n−1) · Σ_j c_j(c_j−1) / ( n(n−1) ) ← 해석적 기대값 p-value = Pr( R* ≤ R_obs ), R* = 순열 재표집 통계량 ← 몬테카를로

      p-값 계산: χ² 적합도·독립성 검정은 자유도가 모두 짝수(4·8·16)라 생존함수를 닫힌 형태 exp(−x/2)·Σ(x/2)ⁱ/i!로 정확히 계산합니다. 순열·부트스트랩은 시드 고정(seed=20260912) 몬테카를로이며, 반복 수는 각 절에 표기했습니다.

      §3분석 1 — 주변분포는 균등한가

      χ² 적합도 검정 · Wilson 신뢰구간 · Benjamini–Hochberg 보정

      가장 흔한 질문부터. 22년치를 다 합쳤을 때 ①~⑤가 각각 20%씩 나오는가? 답은 "거의, 그러나 완전히는 아니다"이다.

      표 3. 번호별 전수 빈도. p는 20% 대비 양측 이항검정, q는 5개 검정에 대한 BH 보정값(FDR).

      그림 1. 번호별 출현 비율과 Wilson 95% 신뢰구간. 점선은 균등 기대치 20%.

      효과 크기를 보라. 편차는 통계적으로는 유의해도 실무적으로는 거의 무의미하다. Cramér's V = — 로, 관습적 기준(0.1 = 작음)의 5분의 1이다. "①번은 적게 나오니 ①을 피하라"는 전략의 기대 이득은 문항당 1.4%p 남짓이고, 이는 §8의 부족 번호 전략이 주는 이득에 비하면 반올림 오차다. n이 8천이면 아무 편차나 유의해진다는 것을 보여주는 교과서적 사례다.

      판정

      주변분포 균등성은 기각되지만 실용적 의미는 없다. 고정 번호 찍기(③ 고정, ⑤ 고정)가 시뮬레이션 탭에서 무작위와 구별되지 않는 이유가 바로 이것이다.

      §4분석 2 — 시험 안에서는? 과소산포의 발견

      이 해설서에서 가장 중요한 절 · 분산 지수(dispersion index) · 몬테카를로 귀무분포

      §3은 22년치를 합쳐서 봤다. 그런데 전략이 작동하는 무대는 시험지 한 장이다. 배열 하나하나에서 번호 개수가 얼마나 흩어져 있는지를 보면 전혀 다른 그림이 나온다. 각 배열에 대해 균등 기대치 대비 Pearson 통계량 X² = Σ(c_j − n/5)² / (n/5) 를 계산하자. 독립 균등 다항분포(M0)라면 이 값은 근사적으로 χ²(4)를 따르므로 평균 4여야 한다.

      그림 2. 배열별 X² 통계량의 관측 분포(막대)와 무작위 귀무분포 χ²(4)(곡선). 관측값이 0 근처에 몰려 있다 — 이것이 과소산포이며, 사람이 개수를 맞췄다는 증거다.

      표 4. 배열 길이별 과소산포. 길이가 다르면 균등화의 강도도 다르다 — 50문항 구 외국어·언어영역 배열이 가장 빡빡하게 맞춰져 있고, 20문항 탐구 배열이 가장 느슨하다. 이 의존성 때문에 전체 평균 φ를 연도별로 비교할 때 함정에 빠진다(§10).

      왜 이것이 결정적인가. 45문항 시험이 진짜 무작위라면 어떤 번호가 4개 이하로만 나올 확률이 —%, 14개 이상 나올 확률이 —%다. 그런데 실제 45문항 배열 —개에서 그런 일은 단 한 번도 일어나지 않았다. 관측 개수는 언제나 — 사이였다. 이것은 우연으로 설명되지 않는다 — 누군가 세어 보고 맞춘 것이다.

      판정

      M1(배열 내 균등성) 강하게 기각. 이것이 Bar-Hillel & Attali(2002)가 SAT에서 "key balancing"이라 부른 현상의 수능 재현이며, 부족 번호 전략의 유일한 진짜 근거다.

      §5분석 3 — 과잉 교대: 사람은 반복을 못 만든다

      조건부 순열검정 · Wagenaar(1972) 가설의 직접 검정

      "같은 번호가 세 번 연속이면 이상하다"는 느낌 — 심리학에서는 과잉 교대(over-alternation)라 부른다. 문제는 §4에서 본 균등화 자체가 이미 반복을 줄인다는 것이다. 개수를 맞추려면 한 번호를 몰아 쓸 수 없으니까. 따라서 균등화를 통제한 뒤에도 반복이 더 적은지를 물어야 한다. 그것이 §2의 M2 순열검정이다.

      표 5. 인접 반복 검정. "순열 기대"는 각 배열의 번호 개수를 그대로 둔 채 순서만 섞었을 때의 기대치이므로, 균등화 효과가 제거된 비교다.

      그림 3. 배열별 최장 연속 길이 분포(관측). 336개 배열을 통틀어 4연속은 단 1회다.

      판정

      M2(순서 무작위성) 기각. 균등화만으로는 설명되지 않는 추가적 반복 회피가 존재한다 — 배열을 만든 것은 난수 발생기가 아니라 사람이다.

      §6분석 4 — "앞뒤 10문제를 알면 그 문제를 맞힐 수 있나"

      래그 프로파일(correlogram) · 국소 정보의 도달 거리

      이 프로젝트의 출발점이 된 질문이다. 인접 반복이 억제된다면(§5), 거리 k만큼 떨어진 두 문항 사이에도 그런 억제가 있을까? 각 래그 k에서 "같은 번호일 확률"을 관측값과 순열 기대치로 비교한다.

      그림 4. 래그별 "같은 번호일 확률"의 순열 기대치 대비 편차(%p). 회색 띠는 ±2 표준오차. 음수 = 같은 번호가 기대보다 드묾.

      표 6. 래그 프로파일 수치. q는 10개 래그에 대한 BH 보정값.

      원 질문에 대한 답

      "앞뒤 10문제"는 거의 쓸모없다. 국소 의존성은 ±3문항에서 완전히 소멸한다. §8에서 보듯 창을 넓혀 얻는 이득은 국소 상관이 아니라 단지 세는 표본이 커져서일 뿐이며, 결국 답안지 전체를 세는 것이 언제나 최선이다.

      §7분석 5 — 1차 마르코프 전이행렬

      "③ 다음엔 뭐가 오나" · 그리고 이 검정이 과대평가인 이유

      래그 1을 방향까지 포함해 보면 5×5 전이행렬이 된다. 행 = 현재 문항의 정답, 열 = 다음 문항의 정답. 완전 무작위라면 모든 칸이 20%여야 한다.

      그림 5. 행 기준 전이 확률(%). 붉은색 = 20%보다 낮음, 파란색 = 높음. 대각선만 선명하게 붉다 — 방향성 있는 선호(예: "③ 다음엔 ⑤")는 없고, 오직 "직전과 같은 번호를 피한다"만 있다.

      주의 — 이 χ²는 과대평가다. 독립성 검정의 귀무분포는 "행·열 주변합만 고정"인데, 우리 데이터에는 배열별 개수 고정이라는 더 강한 제약이 이미 걸려 있다. 균등화만으로도 대각선은 얼마간 내려간다. 그래서 §5의 순열검정이 올바른 검정이고, 이 표는 편차의 모양을 보는 용도로만 읽어야 한다. 다행히 두 결론은 일치한다.

      §8분석 6 — 그래서 얼마나 착취 가능한가

      Leave-one-out 전수 평가 · Wilson 구간 · 배열 클러스터 부트스트랩

      통계적 유의성은 전략의 가치를 말해주지 않는다. 여기서는 적중률을 직접 잰다. 설계는 leave-one-out: 배열의 한 문항을 가리고, 나머지 문항의 정답을 모두 안다고 가정한 뒤 가장 적게 나온 번호를 찍는다. 동률이면 그중 무작위 선택(기여도를 1/동률수로 계산해 편향을 없앤다). 전체 —문항을 하나도 빠짐없이 평가한 전수 조사다.

      표 7. 영역별 leave-one-out 적중률. 95% 구간은 Wilson score(문항 단위)이며, 배열 단위 상관을 고려한 클러스터 부트스트랩 구간을 함께 보고한다.

      그림 6. 45문항 배열에서 "앞뒤 ±w문항만 세었을 때"의 적중률. 곡선이 계속 오르다가 전체(±22)에서 멈춘다 — 세는 범위가 넓을수록 좋고, 국소 창에 특별한 정보는 없다.

      수학이 왜 압도적인가. 수학 객관식은 21문항뿐이라 번호당 기대 개수가 4.2개에 불과하고, 균등화가 걸리면 "남는 자리"가 거의 확정된다. 정보이론적으로 말하면 배열이 짧을수록 개수 제약이 배열 엔트로피를 더 많이 깎는다. 실제로 배열 내 평균 엔트로피는 — bit로, 무작위 기대치 — bit보다 높다(균등화는 엔트로피를 최대치 log₂5=2.3219에 밀어붙인다).

      판정

      착취 가능성은 실재하고 크다. 다만 이것은 "나머지를 다 안다"는 상한이며, 모르는 문항이 늘수록 급격히 줄어든다(시뮬레이션 탭의 k곡선). 그리고 어떤 경우에도 선지 하나를 소거하는 것(20%→25%)이 이 모든 통계보다 크다.

      §9분석 7 — 위치 효과 (탐색적)

      시험지 앞/중/뒤에서 번호 분포가 달라지는가

      각 배열을 앞·중·뒤 세 구간으로 나눠 번호 분포를 비교했다. 이것은 사전 가설이 아니라 탐색적 분석이므로, 결과는 "재현 대상"이지 "발견"이 아니다.

      표 8. 배열 내 상대 위치별 번호 분포(%). χ² 독립성 검정, df=8.

      §10가짜 신호 감별 — 이 데이터가 사람을 속이는 세 가지 방법

      해설서의 절반은 "무엇을 믿지 말아야 하는가"다

      (1) 구성 혼재 — 존재하지 않는 시간 추세. 연도별 과소산포 지수 φ를 그대로 회귀하면 강한 증가 추세가 나온다 (r=—). "최근 들어 균등화가 느슨해졌다"고 쓰고 싶어지는 결과다. 그러나 이는 표본 구성이 바뀐 탓이다 — 2012학년도부터 20문항 탐구 배열이 대거 편입되는데, 짧은 배열은 구조적으로 φ가 높다(표 4). 배열 길이를 고정하면 추세는 사라지거나 반대 방향이 된다: 45문항만 보면 r=—, 20문항만 보면 r=—. 전형적인 Simpson의 역설이며, 이 페이지가 연도 추세를 주장하지 않는 이유다.

      (2) 사후선택(data snooping) — "역대 최빈 번호". §3에서 ⑤가 가장 많이 나왔다. 그러니 ⑤로 찍으면 유리할까? 아니다. ⑤를 고른 근거가 바로 그 데이터이기 때문이다. 같은 표본에서 최댓값을 고르고 같은 표본에서 성능을 재면 언제나 이긴 것처럼 보인다. 실제로 시뮬레이션 탭의 '⑤번 고정' 전략은 무작위와 구별되지 않으며, §3의 편차가 BH 보정 후 겨우 살아남는 크기(V=—)라는 사실이 그 이유를 말해준다.

      (3) 다중비교 — 래그 9의 유혹. 표 6에서 래그 9는 양의 편차가 보정 후에도 살아남는다. 이것을 "9문항 주기가 있다"고 해석하고 싶어지지만, 사전 가설이 없고 구조적 설명도 없다. 20문항 배열에서 래그 9는 배열 중앙을 가로지르는 특이한 짝짓기이고, 래그가 커질수록 유효 표본이 줄어 분산도 커진다. 단일 래그의 양의 신호는 독립 표본에서 재현되기 전까지 잡음으로 취급하는 것이 맞다. 이 해설서가 전략으로 승격시킨 것은 래그 1~3의 음의 편차뿐이며, 그것조차 §8에서 "전체 카운트에 흡수된다"는 결론으로 끝난다.

      일반 원칙

      이 데이터에서 무언가를 발견했다고 느낄 때마다 세 가지를 확인하라 — (a) 표본 구성이 바뀌지 않았는가, (b) 가설을 데이터에서 읽어내지 않았는가, (c) 몇 개의 검정을 돌렸는가. 셋 다 통과하는 결과는 이 페이지에 딱 둘뿐이다: 과소산포(§4)와 과잉 교대(§5).

      §11결과 종합

      모든 검정을 한 표에

      표 9. 전체 검정 요약. 몬테카를로 p-값의 하한은 반복 수에 의해 결정된다 (예: 20,000회 반복에서 p < 5×10⁻⁵).

      한 문장 요약. 수능 정답 배열은 주변분포는 거의 완벽하게 균등하지만(§3), 배열 내부는 무작위보다 4배 이상 덜 흩어져 있고(§4), 그 위에 인접 반복을 피하는 인간적 습관이 덧씌워져 있다(§5). 앞의 둘은 착취 가능하고(§8), 뒤의 하나는 사실상 착취 불가능하다(§6, §8) — 전체 카운트가 국소 정보를 이미 다 흡수하기 때문이다.

      §12R 재현 코드

      §1의 CSV를 받아 그대로 실행하면 이 페이지의 모든 수치가 재현됩니다 (R ≥ 4.1)

      
          

      이 페이지 자체는 브라우저에서 순수 JavaScript로 같은 계산을 수행합니다 (χ² 생존함수는 짝수 자유도 닫힌 형태, 순열·부트스트랩은 mulberry32 시드 고정). R 결과와 소수점 둘째 자리까지 일치하며, 몬테카를로 항목만 반복 수에 따라 마지막 자리가 흔들릴 수 있습니다.

      §13한계와 해석 주의

      표 10. 알려진 한계와 그것이 결론에 미치는 영향.

      가장 중요한 한계. 이 모든 분석은 과거 22개 학년도에 대한 기술(description)이다. 출제기관이 균등화 절차를 바꾸면 §4의 φ는 하루아침에 1.0으로 돌아갈 수 있고, 그러면 §8의 41.8%도 20%가 된다. 이 페이지는 예언이 아니라 관측 기록이다.

      그리고 통계학적으로 가장 정직한 결론은 이것이다 — 이 모든 것은 "나머지를 안다"는 조건부 확률이다. 조건부의 조건을 채우는 유일한 방법은 공부이고, 선지 하나를 소거하는 것이 여기 나온 어떤 검정보다 기대값을 많이 올린다. 통계는 소거가 끝난 뒤 남은 선지들 사이에서만 쓰는 도구다.

      선행 문헌 — Bar-Hillel & Attali (2002), The American Statistician 56(4); Attali & Bar-Hillel (2003), J. Educational Measurement 40(2); Wagenaar (1972), Psychological Bulletin 77; Budescu & Bar-Hillel (1993), J. Educational Measurement 30(4). 상세 해제는 '시뮬레이션' 탭의 '이론적 배경'을 참조.

      2005~2026학년도 · 실제 수능 정답 배열 336개 · 연구 재현

      마지막 한 문제는,
      찍지 말고 계산합니다.

      수능 정답 배열은 무작위가 아니라 사람이 균등하게 다듬은 배열입니다. 이 사실은 SAT에서 학술적으로 입증되었고(Bar-Hillel & Attali, 2002), 이 사이트는 같은 분석을 22개 학년도 수능 정답 전체로 재현해 — 어떤 상황에서, 어떤 방법이, 정확히 몇 %나 통하는지를 실측했습니다.

      배경. 표준화 시험의 정답 키는 무작위가 아니라 의도적으로 균등화되며, 이 사실이 통계적으로 착취 가능함은 SAT 전수 분석으로 입증되어 있다(Bar-Hillel & Attali, 2002, The American Statistician). 대학수학능력시험 정답 배열에 대한 동일한 실증은 학술 문헌에서 확인되지 않았다.

      방법. 한국교육과정평가원 공식 아카이브의 2005~2026학년도 정답표(홀수형)를 원문 파싱·수기 판독으로 전산화하고, 일곱 가지 추측 전략을 실제 배열 위에서 몬테카를로 재표집으로 백테스트하였다. 구간 추정은 Wilson 95% 신뢰구간, 유의성은 무작위 기대치 20% 대비 이항 z-검정을 사용하였다.

      결과. 균등화 제약과 연속 회피는 전 기간에서 관찰되었다. 모르는 문항이 1개일 때 "잔여 선지 중 부족 번호" 전략의 실측 적중률은 39.5%(국어·영어)~53.0%(수학 객관식)이며, 내용 소거와 결합 시 최대 66%에 이른다. 고정 번호 전략은 무작위와 구분되지 않았고, 최다 번호 추종은 6~12%로 유해했다.

      결론. 통계 전략은 풀이를 대체하지 못하나, 풀이가 끝난 뒤 남은 소수 문항에서는 재현 가능한 기대값 우위를 제공한다. 본 도구는 그 우위를 훈련 가능한 절차로 변환한다.

      이 사이트가 효과 있는 지점 — 딱 하나의 시나리오

      모든 수치가 가리키는 최적 사용처는 명확합니다. 시험을 거의 다 풀었고, 모르는 문제가 한두 개 남았을 때. 그때 아래 세 단계를 밟으면, 무작위 20%였던 문제가 실측 44~66%짜리 문제로 바뀝니다.

      1

      내용으로 소거합니다. "이 선지는 확실히 아니다"만 지웁니다. 애매하면 남겨 둡니다. 소거 하나하나가 아래 사다리의 가장 큰 계단입니다.

      2

      답안지의 ①~⑤ 개수를 셉니다(10초). 거의 다 풀었기 때문에 이 카운트는 정확합니다 — 모르는 문제가 많을수록 이 정보는 흐려집니다. 그래서 "마지막 한 문제"가 이 방법의 최적 지점입니다.

      3

      살아남은 선지 중, 가장 적게 나온 번호를 고릅니다. 정답 배열이 균등하게 다듬어지기 때문에 덜 나온 번호가 정답일 확률이 실제로 높습니다.


      실측 승률 사다리 — 국어·영어(45문항), 마지막 1문항 기준

      20%아무 번호나 찍기
      →
      25%선지 1개 소거만
      →
      44%소거 1개 + 남은 선지 중 부족 번호
      →
      53%소거 2개 + 부족 번호

      그림 1. 소거·부족 번호 결합 전략의 실측 승률 사다리 (국어·영어 45문항, 마지막 1문항, 시행당 5만~35만 문항 백테스트). 같은 조건에서 수학 객관식은 56→66%, 한국사·탐구는 40→54%까지 상승. 소거 없이 부족 번호만 사용해도 39~56%.

      왜 믿을 수 있는가 — 세 겹의 근거

      • 학술 문헌. 출제기관이 정답 키를 균등화하며 이것이 착취 가능하다는 사실은 Bar-Hillel & Attali(2002)가 실제 SAT 1,280문항으로 입증한 결과입니다. 사람이 반복을 회피한다는 근거는 Wagenaar(1972)의 고전 연구입니다.
      • 수능 데이터 재현. 시뮬레이션 탭의 '연구 검증'이 문헌 예측을 수능 실제 배열로 검정합니다 — 45문항 배열 35개 전부가 번호별 6~12개 범위 안(무작위라면 60%가 이탈), 4연속 이상은 단 1개(무작위 기대 24%).
      • 훈련 가능성. 시험 기술 훈련의 평균 효과는 0.33 표준편차 (Samson 1985, 24개 연구 메타분석). 아는 것과 몸에 배는 것은 다릅니다 — 그래서 실전 연습 탭이 있습니다.

      효과 없는 것도 압니다 — 정직한 한계

      • "③이 잘 나온다" 같은 고정 번호 신앙은 무의미합니다 — 실측 20.2~21.0%, 무작위와 구분 불가.
      • 많이 나온 번호를 따라가면 역효과입니다 — 실측 6~12%, 무작위의 절반 이하.
      • 모르는 문제가 5개 이상이면 우위가 줄어듭니다(k=10에서 28~31%). 그때는 마킹 실수 방지가 더 중요합니다.
      • 수학 단답형(0~999)은 별세계입니다 — 역대 최빈값을 찍어도 기대치는 약 5%. 단답형 탭에서 냉정한 분포를 확인하세요.
      • 모든 수치는 과거 배열의 사후 검증입니다. 출제 방침이 바뀌면 달라질 수 있고, 공부를 대체하지 못합니다.

      준비됐다면, 실제 기출 배열로 감각부터 만들어 보세요.

      연습 설정

      "이 선지는 확실히 아니다"를 이미 아는 상태를 가정합니다. 소거된 선지는 답안지에 줄이 그어져 나오고, 비교용 부족 번호 전략도 남은 선지 안에서만 고릅니다.

      실제 수능 정답 배열에서 한 문항을 가리고, 위아래 5문제씩의 정답만 보여줍니다. 공개된 10개 안팎의 번호 분포를 근거로 가려진 문항의 답을 추리해 보세요. 끝나면 성적 분석과 확률을 높이는 조언을 드립니다.

      왼쪽에서 과목과 문제 수를 고르고 연습 시작을 누르세요. 2005~2026학년도 수능 배열 —개에서 무작위로 출제됩니다.

      대원칙 — 순서가 곧 점수다

      Ⅰ

      내용 > 통계

      모든 통계 전략은 내용으로 풀 수 없을 때만 씁니다. 선지 하나를 지식으로 지우는 것(20%→25%)이 어떤 분포 계산보다 확실한 이득입니다. 이 페이지의 모든 지침은 "풀이가 끝난 뒤 남은 문제"에 관한 것입니다.

      Ⅱ

      찍기는 종료 2~3분 전, 한 번에

      문제마다 그때그때 찍지 마세요. 모르는 문제는 표시만 해 두고 끝까지 풉니다. 종료 2~3분 전, 남은 문제 전체를 놓고 한 번의 카운트, 한 번의 결정으로 일괄 마킹합니다. 정보가 가장 많은 시점이 통계가 가장 강한 시점입니다.

      Ⅲ

      확실성의 위계를 지켜라

      지식에 의한 소거 → 답안지 전체 분포 → (±5)창 분포 → 기타 규칙 순서로만 신뢰하세요. 아래 백테스트가 보여주듯 하위 규칙("직전 번호 회피" 등)은 효과가 거의 없습니다.

      시험장 3단계 프로토콜

      1

      선지 내용으로 소거

      확실히 아닌 선지를 지웁니다. 하나만 지워도 기대치가 25%로, 둘을 지우면 33%로 뜁니다. 소거 결과는 3단계에서 부족 번호와 교차시킵니다.

      +5~13%p · 가장 확실한 이득

      2

      답안지 번호 세기 (10초)

      지금까지 마킹한 ①~⑤ 개수를 셉니다. 마킹 안 된 문제는 건너뜁니다. 가장 적게 나온 번호가 부족 번호입니다. 동률이면 둘 다 후보로 둡니다.

      15개년 전 배열에서 번호별 개수는 좁은 범위에 갇혀 있음

      3

      소거 ∩ 부족 번호로 통일 마킹

      살아남은 선지 중 부족 번호를 고르고, 남은 모든 문제를 그 한 번호로 통일해 마킹합니다. 통일은 기대치를 지키면서 마킹 밀림 사고를 구조적으로 차단합니다.

      마지막 1문항: 실측 39~53% (아래 백테스트)


      실행 예시

      국어 45문항 중 43문항을 풀고 12번·31번이 남았다고 합시다. 답안지를 세니 ①9 ②8 ③10 ④9 ⑤7. 부족 번호는 ⑤입니다. 12번에서 내용상 ②를 지웠고 ⑤는 살아 있으므로 12번=⑤. 31번은 소거 없음 → 그대로 ⑤. 두 문제 모두 ⑤로 통일 마킹하고 검토로 돌아갑니다. 결정에 쓴 시간: 약 30초.

      상황별 매뉴얼 — 실측 기대치와 함께

      상황권장 행동실측 기대치 (문항당)
      1문제 남음 답안지 전체 카운트 → 소거와 교차 → 부족 번호 국어·영어 39.5% · 수학 객관식 53.0% · 탐구 39.8%
      2~4문제 남음 부족 번호 하나로 통일 마킹 35~39% (k=2~4 백테스트 평균)
      5~7문제 남음 여전히 부족 번호 통일 — 기대치는 낮아지지만 무작위보다 항상 우위 31~35%
      8문제 이상 남음 부족 번호 통일 + 마킹 실수 방지에 집중. 남는 시간은 한 문제라도 더 푸는 데 28~31% (무작위 20% 대비 여전히 +8~11%p)
      시간 전무, 통마킹 세는 시간조차 없으면 아무 한 번호로 전부 통일 (밀림 방지가 목적) ≈20% (기대치 동일, 사고 위험만 감소)

      기대치는 이 앱의 15개년 실제 배열 백테스트(시뮬레이션 탭) 결과입니다. 모두 "모르는 문항"에 대한 문항당 적중률입니다.

      시험 유형별 노트

      • 국어·영어 (45문항) — 균등화가 가장 강한 유형. 15개년 모든 배열에서 번호별 6~12개(기대 9개). 표본이 커서 카운트 정보의 신뢰도가 높습니다. 부족 번호 전략의 표준 무대.
      • 수학 객관식 (21문항) — 공통·선택이 따로 출제되어 균형이 가장 느슨합니다(번호별 1~6개까지 관측). 역설적으로 그 덕분에 마지막 1문항 부족 번호 적중률이 53%로 전 유형 최고입니다. 단, 셀 때 단답형(16~22, 29~30번)은 제외하고 객관식 21문항만 세야 합니다.
      • 한국사·탐구 (20문항) — 번호별 2~6개. 문항 수가 적어 한 문항의 정보 가치가 큽니다. 20문항 중 19문항을 알면 부족 번호가 사실상 드러납니다(실측 39.8%).
      • 수학 단답형 (0~999) — 선지형 통계가 전혀 통하지 않는 별세계입니다. 역대 최빈값 찍기로도 기대치는 몇 % 수준 — 자세한 분포와 전략은 수학 단답형 탭을 보세요.

      데이터가 검증한 금지 목록

      이미 푼 문제의 답을 "분포에 맞추려고" 바꾸기

      내용으로 푼 답의 정답률(수십 %)을 통계적 기대치(20~40%)와 바꾸는 행위입니다. 산술적으로 항상 손해입니다. 분포가 이상해 보여도 그대로 두세요 — 실제 배열도 8:12처럼 기울어진 해가 있습니다.

      단, 구분할 것 — 재검토 중 내용상 근거가 생겨 바꾸는 것은 다릅니다. 1928년 이래 33개 연구를 종합한 Benjamin 외(1984)에 따르면 내용 기반 답 변경의 다수는 오답→정답이며, "첫 직감을 지켜라"는 통념은 바꿨다 틀렸을 때의 후회가 더 강하게 기억되는 착각(Kruger 외 2005, 첫 직감 오류)일 뿐입니다. 금지되는 것은 오직 통계를 이유로 한 변경입니다.

      최다 번호로 찍기 (군중심리의 반대편)

      백테스트 실측 6~12% — 무작위의 절반도 안 됩니다. 균등화 제약은 이미 많이 나온 번호를 강하게 배척합니다. "많이 나온 번호가 대세"라는 직감은 수능 답안지에서 정확히 거꾸로 작동합니다.

      "③이 제일 많다더라" 식 고정 번호 신앙

      ③ 고정의 실측 승률은 20.2~21.0% — 무작위와 통계적으로 구분되지 않습니다. 역대 번호별 비율은 17.9~21.9% 범위에서 미세하게 출렁일 뿐입니다.

      "직전 문제와 같은 번호 피하기" 단독 사용

      실측 21~24.5%로 +2%p 남짓의 미미한 효과. 연속 제약이 실재하긴 하지만(최장 4연속), 부족 번호 카운트가 이 정보를 대부분 흡수합니다. 카운트할 시간이 있으면 항상 카운트가 우선.

      작년 정답 패턴으로 올해 문항 예측

      "작년 7번이 ③이었으니 올해는…" — 회차 간 문항별 상관은 0입니다. 매년 출제진이 바뀌고 배열은 새로 균등화됩니다. 회차 안에서의 균형만이 유일한 신호입니다.

      마킹 사고 방지 — 마지막 2분 절차

      1

      남은 문제 확정

      문제지에 남은 문항 번호를 크게 표시합니다. "몇 번이 비었는지"를 헷갈리는 순간 밀려 쓰기가 시작됩니다.

      2

      카운트 → 결정 → 일괄 마킹

      부족 번호를 정했으면 남은 문항을 위에서 아래로 한 번에 마킹합니다. 문항 번호를 소리 없이 입으로 확인하며 칠하세요.

      3

      줄 밀림 최종 점검

      마지막 30초는 새 문제가 아니라 답안지-문제지 번호 대조에 씁니다. 특히 건너뛰었던 문항 전후를 확인하세요.

      알아두면 좋은 사실과 한계

      • ①은 역사적으로 가장 적게 나온 번호입니다 (45문항 17.9%, 수학 18.6%, 탐구 18.8%). 다만 차이가 작고 사후 관찰이라, 부족 번호 카운트와 충돌하면 언제나 카운트가 우선입니다.
      • ±5문항 창 전략(실전 연습 탭)의 실측치는 26~38% — 답안지 전체 카운트(최대 53%)보다 항상 약합니다. 연습 탭은 감각 훈련용이고, 실전에서는 전체를 세세요.
      • 모든 수치는 과거 배열의 사후 백테스트입니다. 평가원이 배열 규칙을 바꾸면 달라질 수 있고, 미래 시험에 대한 보장이 아닙니다.
      • 기대치의 본질을 기억하세요: 부족 번호 39%는 "10번 중 6번은 틀린다"는 뜻이기도 합니다. 이 페이지의 목적은 요행이 아니라 같은 상황에서 항상 기대값이 더 높은 쪽을 고르는 습관입니다.

      이 지침의 연구 계보