LAST SCORE — 08.17 민주당 전당대회 당선자 적중 · 다음 채점 — T+7 여론 예측, 매일 갱신
Reble Labs
여론의 복잡계를 해독한다
Reble Labs는 현실 사회를 통계적으로 재현하고, 조건이 달라졌을 때 사람들의 선택이 어떻게 움직이는지를 실험하는 확률론적 사회 시뮬레이션 엔진을 만듭니다. 정치와 선거, 정책과 사회, 마케팅과 브랜드 — 사람의 선택이 결과를 만드는 모든 곳이 대상입니다. 선거는 그중 정답이 공개되는 유일한 영역이라, 엔진을 채점하는 시험장으로 씁니다.
첫째, 묻기가 어려워졌습니다. 전화 응답률은 계속 떨어지고, 응답하는 사람과 응답하지 않는 사람이 체계적으로 다릅니다. 표본은 점점 인구를 닮지 않게 되는데 비용과 시간은 늘어납니다.
둘째, 물어서 얻은 답이 행동과 다릅니다. 사람은 자기가 무엇을 살지, 어디에 투표할지, 그 메시지에 어떻게 반응할지를 스스로 정확히 예측하지 못합니다. 설문의 답과 실제 행동 사이에는 늘 간격이 있습니다.
묻는 것만으로는 알 수 없다면, 재현해서 실험해 보는 수밖에 없습니다.
그래서 인구를 통계적으로 재현하고, 그 위에서 조건을 바꿔 가며 반복 실행하는 접근이 필요해졌습니다. 다만 이 방식에는 곧바로 따라붙는 의심이 있습니다 — “그렇게 만들어낸 숫자를 어떻게 믿는가.” 저희가 가장 무겁게 다루는 질문이 바로 이것이고, 뒤의 04절이 그에 대한 답입니다.
02여론조사의 세 가지 한계
여론조사는 훌륭한 도구지만, 그 자체로는 세 가지 구조적 한계를 안고 있습니다.
TIME LAG
시차
조사 시점과 발표 시점 사이의 지연 때문에, 공표된 숫자는 이미 지나간 민심입니다.
REPRESENTATION
표본 대표성 훼손
응답률이 낮아질수록 표본은 인구를 닮지 않게 되고, 그 왜곡이 구조적 노이즈로 남습니다.
HOUSE EFFECT
기관·방식 편향
같은 시점 같은 선거인데도 조사기관과 방식(ARS·전화면접)에 따라 결과가 체계적으로 갈립니다.
여론조사는 정답표가 아니라, 지연되고 왜곡된 한 장의 스냅샷입니다.
03무엇을 바꿨나
하나의 숫자(점추정)를 내놓는 대신, 결과가 어떤 범위로 펼쳐지는지(확률 분포)를 계산합니다.
왼쪽은 한 시점을 잘라낸 조사 결과, 오른쪽은 조건을 바꿔 가며 반복한 시뮬레이션의 분포. 같은 데이터라도 답의 형태가 달라집니다.
기존 여론조사
Reble 엔진
결과물
단일 숫자 (점추정)
승리확률과 신뢰구간 (확률 분포)
시간성
정태적 단면 조사
칼만 필터 기반 잠재 지지율 동태 추정
데이터
개별 조사의 파편화
시간·기관 가중치를 적용한 통합 보정
시나리오
고정된 결과
투표율 등 반사실 조건 시뮬레이션
'누가 앞서는가'라는 질문을 '어떤 조건에서 판세의 구조적 변동이 발생하는가'로 바꿉니다.
04엔진은 무엇으로 되어 있나
핵심 부품은 합성패널입니다. 실제 사람을 복제한 명단이 아니라, 인구구조와 조사 결과를 반영해 만든 통계적 시민입니다.
합성패널 한 명은 세 겹으로 이루어집니다. 관측된 인구 정보 위에 예측된 행동 속성을 얹고, 그 위에서 질문에 확률로 답하는 반응 함수가 작동합니다.
이 패널이 실제 예측이 되기까지는 여덟 단계를 거칩니다. 각 단계는 서로 다른 종류의 왜곡을 하나씩 걷어냅니다.
공표 조사를 정제하고, 편들지 않는 사전분포에서 출발해, 최근 데이터에 무게를 싣고, 기관 편향을 중화하고, 숨은 추세를 복원한 뒤, 합성패널에 태워 수만 번 반복합니다.
05무엇을 지키나
예측 모델의 진짜 시험은 정확도가 아니라 정직성입니다. 결과를 본 뒤에 기준을 옮기면 어떤 예측이든 맞은 것처럼 보이게 만들 수 있기 때문입니다.
예측을 개표 전에 파일로 동결하고, 통과 기준을 미리 선언하고, 실측 앞에 세우고, 기준을 바꾸지 않습니다.
그래서 계산이 끝난 숫자라도 사전에 정한 검증 관문을 넘지 못하면 공개하지 않습니다. 무엇이 실제 관측값이고 무엇이 모델의 예측인지, 어떤 가정이 들어갔고 불확실성이 어느 정도인지를 결과와 함께 적습니다.
인구를 재현해 답을 만들어내는 접근에는 “그 숫자를 어떻게 믿는가”라는 의심이 항상 따라붙습니다. 저희는 그 답을 방법론이 아니라 절차에서 찾습니다 — 미리 잠그고, 기준을 먼저 밝히고, 결과 앞에 세우는 것입니다.
사람에게 직접 묻는 방식, AI에게 사람인 척 답하게 하는 방식, 그리고 인구구조와 공표 데이터에 정합된 확률 모델. 세 번째는 느리지만 무엇이 관측이고 무엇이 가정인지가 기록으로 남습니다.