숫자보다 방법이 먼저다
안녕하세요, 탑에듀프렙입니다. 오늘은 SAT 수학에서 학생들이 유독 어려워하는 통계 파트 이야기를 해볼까 해요. 계산은 다 할 줄 아는데 자꾸 틀리는 그 문제들, 사실 이유는 하나예요. "숫자를 계산하는 문제"가 아니라 "논리를 판단하는 문제"라는 걸 모르고 풀기 때문이죠.
문제 1: "이 결과, 어디까지 믿을 수 있을까?"
한 회사 직원 60명을 무작위로 뽑아서 설문을 했더니, 정규직 1명에 비정규직 59명이 뽑혔어요. 이 결과를 어디까지 일반화할 수 있을까요?
여기서 학생들이 자꾸 "숫자"를 보고 판단하려고 해요. "비정규직이 훨씬 많으니까 비정규직에 대해서만 말할 수 있겠지?" 아니에요. 표본을 어떻게 뽑았는지가 전부예요. 표본을 회사 전체 직원 중에서 무작위로 뽑았다면, 결과가 우연히 비정규직 쪽으로 치우쳐 나왔더라도 일반화할 수 있는 대상은 여전히 "회사 전체 직원"이에요. 뽑고 보니 비율이 한쪽으로 쏠린 거지, 뽑는 "방법" 자체는 전체를 대표하도록 설계됐으니까요.
이게 SAT가 진짜 묻고 싶은 거예요. "너, 표본추출(sampling)과 표본결과(result)를 구분할 줄 아니?"
문제 2: 오차범위(margin of error)는 왜 어떤 날은 크고 어떤 날은 작을까
반려동물 용품점에서 고양이를 키우는 고객 비율을 두 번 조사했어요. A 표본은 27%에 오차범위 4%, B 표본은 30%에 오차범위 6%. 왜 B의 오차범위가 더 클까요?
많은 학생들이 여기서 "고양이 키우는 비율이 높아서"라고 답을 고르는 함정에 빠져요. 그럴듯해 보이지만 틀렸어요. 오차범위를 결정하는 핵심 변수는 딱 하나, 표본의 크기(sample size)예요. 표본이 작을수록 오차범위는 커져요. 비율이 27%든 30%든, 그 숫자 자체는 오차범위와 직접적인 인과관계가 없어요. 이걸 몰라서 "비율이 높으니까 오차도 크겠지"라는 감으로 찍는 학생들이 정말 많습니다.
SAT는 이렇게 "그럴듯한 오답"을 정확히 심어놓고, 개념을 진짜 이해했는지 시험해요.
문제 3: 표본이 편향되면, 숫자가 아무리 그럴듯해도 소용없다
15층짜리 건물에서 전체 입주민의 평균 나이를 추정하려고, 무작위로 3개 층을 뽑아서 그 층에 사는 102명을 전수조사했어요. 평균 나이는 31세로 나왔죠. 이 결과에 대해 반드시 참인 말은?
여기서 정답은 "건물 전체 평균 나이가 31세일 가능성이 있다(plausible)" 정도의 조심스러운 표현이에요. "반드시 31세다"라고 단정하는 선택지는 함정이고, "표본이 너무 작아서 추정 자체가 불가능하다"는 선택지도 과장된 함정이에요.
그런데 사실 이 문제의 진짜 핵심은 따로 있어요. 바로 "층 단위로 뽑았다"는 부분. 개인을 무작위로 뽑은 게 아니라 "층"을 무작위로 뽑고 그 층 사람들을 몽땅 조사했죠. 이건 엄밀히 말하면 단순무작위추출이 아니라 군집표집(cluster sampling)에 가까워요. 같은 층에 사는 사람들은 나이가 비슷한 경향(가족 단위, 직장인 단지 등)이 있을 수 있어서, 개인을 직접 무작위로 뽑았을 때보다 대표성이 떨어질 수 있어요. 그래서 "31세가 정확하다"라고 단정할 수 없고, 딱 "그럴듯하다" 정도로만 말할 수 있는 거예요.
결론: SAT 통계는 계산기가 아니라 "판단력"을 본다
이 세 문제를 관통하는 메시지는 하나예요. SAT 통계 파트는 여러분이 평균, 비율 같은 걸 계산할 줄 아는지 보는 게 아니라, "이 데이터를 얼마나 믿어도 되는지"를 판단하는 능력을 봐요. 표본은 어떻게 뽑혔는지, 크기는 얼마나 되는지, 그 결과를 어디까지 일반화해도 되는지 — 이 세 가지 질문을 습관처럼 던질 수 있으면 통계 문제는 더 이상 어려운 파트가 아니에요.
탑에듀프렙에서는 이런 "함정 패턴"을 문제 하나하나 짚어가며 학생들이 스스로 판단하는 힘을 기르도록 지도하고 있어요. 통계가 유독 헷갈리는 친구라면, 공식을 더 외우기보다 이 논리부터 다시 잡아보는 걸 추천드려요.