검토자료
· 2026년
10월 1일
AI는 사람 응답자를 대신할
수 있는가
퓨리서치센터 합성 조사(신세틱 서베이) 검증
보고서 정리
원문 Pew
Research Center, “Can AI Stand In for Human Survey-Takers? Not Really”, 2026년 9월 30일 발표 (49쪽)
저자
Athena Chapekis, Arnold Lau, Samuel Bestvater, Sono Shah, Andrew Mercer,
Aaron Smith
synthetic은 '합성'으로 옮겼다. 수치는 원문대로 정수로 적었고, 따로 밝히지 않은 합성 결과는 Claude Opus 4.6(추론 수준 low, 확장 프로필, 전문가 성찰 적용) 기준이다. 그림은
원문 수치로 다시 그렸다.
1. 요약
퓨리서치센터가 AI 모델에게 실제 패널 응답자의 '디지털 트윈' 역할을 맡겨 자사 미국 트렌드 패널(ATP) 조사 3개 웨이브를 다시 돌리고, 같은 시기 사람 응답과 문항 단위로 비교했다. 결론은 제목 그대로다. 지금 수준의 AI 모델은 사회적으로 중요한 주제의 여론조사에서 사람 응답자를 대신할 수 없다. 응답자마다 실측 속성 수십 개와 정치유형화 조사 응답 71개 변수를
넣고, 문항 순서와 보기 순서 무작위화까지 재현한 거의 최선의 조건에서 나온 실패 보고라는 점에서 무게가
있다.
1.
3개 웨이브 291개 문항에서 합성 응답과 사람 응답의 평균 절대오차는 12.4%p였다. 15%p를 넘게 틀린 문항이 28%였다.
2.
오차는 모든 집단에서 평균 10%p를 넘었다. 공화당·공화 성향층이 16.1%p로
가장 컸고 대졸 이상이 11.9%p로 가장 작았다.
3.
오차의 방향이 문항마다 달랐다. 의료비 걱정은 13%p 높게, 전기요금 걱정은
29%p 낮게 잡았다. 방향이 일정하지 않으니 사후 보정할 근거도 없다.
4.
학습 시점 이후 바뀐 여론을 따라가지 못했다. 실제 대통령 지지율이 37%에서 34%로 내려가는 동안 합성 조사는 두 번 모두 46%를 냈다.
5.
합성 응답자는 '모름'을 덜 고르고(사람 16%, 합성 4%) 더
많이 알았다(지식 문항 정답률 사람 절반 정도, 합성 80% 정도).
6.
응답 분포의 다양성이 사라졌다. 선택자 0명인
보기가 있는 문항이 47%였고, 집단에서 흔한 의견을 거의
전원의 의견으로 만들었다.
7.
모델을 바꾸면 여론이 바뀌었다. 같은 설계에서 GPT-5.1은 실제보다 극단적인 국민을, Opus 4.6은 실제보다
온건한 국민을 그렸다.
8.
퓨는 AI로 조사 결과를 만들 계획이 지금도 앞으로도 없다고 밝혔다. 개방형 응답 분류나 분석 코드 작성에는 AI를 계속 쓴다.
“ AI polling is
not a replacement for rigorously surveying real humans.
AI 여론조사는 실제 사람을 엄밀하게 조사하는 일을 대신하지 못한다. (원문 8쪽)
2. 퓨의 입장
퓨는 보고서 서두에서 기관 정책부터 밝혔다. 여론을 재려면 대중에게 직접 물어야 하고, AI 모델로 조사 결과를
생성할 계획은 없다는 것이다. 범위도 좁혔다. 이 보고서는 AI를 응답자로 쓰는 경우만 다루며, 결측값 대체 같은 합성 데이터의
다른 용도는 평가하지 않았다.
퓨가 가장 크게 문제 삼은 것은 오차의 크기보다
오차를 미리 알 수 없다는 점이다. AI 결과는 예측할 수 없는 방식으로 사람 결과와 달랐고, 예상하지 못한 현실의 사건이나 모델 선택에 크게 흔들렸다. 더 새로운
모델이나 개선된 방식으로 오차가 줄 수 있다는 점은 인정했지만, 두 모델이 서로 다른 미국 사회를 그렸고
어느 쪽도 실제 여론을 비추지 못했다는 것이 이번 실험의 진짜 이야기라고 정리했다.
3. 실험 설계
퓨는 실제
ATP 응답자 한 사람마다 그 사람을 대신하는 AI 응답자를 하나씩 만들었다. 모델에게 '미국인 몇 %가
찬성하겠는가'를 묻는 집계 추정 방식은 일부러 쓰지 않았다. 집계
추정이 평균화 효과 덕분에 숫자는 더 잘 맞는 경향이 있지만, 이번 연구의 관심은 응답자 단위의 재현이
사람 여론을 어떻게 재현하거나 놓치는지에 있다고 밝혔다. 응답자마다 전체 응답 세트가 있으니 실제 조사처럼
가중치를 적용하고 하위집단별로 나눠 볼 수 있다.
표 1. 재현 대상 웨이브와 결과
|
웨이브 |
주요 주제 |
실사 기간 |
분석 인원·문항 |
평균 절대오차 |
|
W185 |
정치 태도, 트럼프 행정부 평가, 이민단속,
데이터센터 |
2026.1.20~25 |
6,700명·119문항 |
11.4%p |
|
W190 |
국제정치, 국제 문제와 헌법 지식 |
2026.3.23~30 |
3,398명·105문항 |
14.7%p |
|
W192 |
대통령 지지율, 국가 문제, 이란 군사행동, 수면
습관 |
2026.4.20~26 |
4,981명·67문항 |
11.2%p |
주: 2025년
정치유형화 조사도 완료한 패널만 분석. W185는 비용 때문에
8,512명 중 6,700명을 하위표본으로 씀. 3개
웨이브 평균 12.4%p.
모델에게는 세 겹의 정보를 줬다. 거주지, 인종, 종교, 정당 일체감, 이념,
2022·2024년 투표 기록, 소득 등 표준 프로필
50여 개 변수, 2025년 정치유형화 조사 응답 71개
변수(확장 프로필), 그리고 GPT-5.1이 사회과학 전문가 관점에서 프로필의 함의를 정리한 '전문가
성찰'이다. 합성 응답자는 설문을 한 문항씩 순서대로 답했고
앞선 응답이 프롬프트에 계속 쌓였다. 분할 설문 양식, 응답
언어, 문항·보기 순서 무작위화도 짝이 되는 사람과 똑같이
맞췄다. 재현은 사람 조사 실사가 끝난 다음 날부터 시작했다.
프롬프트에는 사람이 갖지 못한 기억력이나
계산 능력을 쓰지 말고, 모르거나 잘못 알고 있는 것도 현실적이며, 무응답도
괜찮다고 적었다. 문항 표현 효과, 보기 순서 효과, 문맥 효과 같은 응답 편향을 반영하라는 지시까지 넣었다. 사람처럼
편향된 응답자가 되라고 요구한 것이다.
설정은 토너먼트 방식으로 골랐다. GPT-5.1로 추론 수준을 비교했더니 low, medium, high 모두
개인 단위 일치율이 55% 안팎으로 차이가 없어 low로
정했다. 프로필은 표준만 줬을 때 평균 절대오차 16.0%p, 확장
프로필을 더하면 13.7%p, 전문가 성찰까지 더하면 13.1%p였다. 모델은 같은 조건에서 Claude Opus 4.6이 11.4%p로 GPT-5.1(13.3%p), GPT-5 nano(17.4%p)보다
나았다. Opus 4.6은 GPT-5.1보다 다섯 배쯤 비쌌다.
오차 지표는 문항 단위 평균 절대오차다. 보기마다 사람과 합성 추정치 차이의 절댓값을 구해 보기 수로 나누고, 이를
다시 문항 전체로 평균한다. 보기 수가 많으면 오차가 희석되는 지표라서, 평균 12.4%p 안에는
30%p, 50%p씩 벌어진 보기들이 함께 들어 있다.
4. 전체 재현 성적
합성 조사 결과는 사람 조사 결과와 평균 12%p 차이가 났다. 표본오차를
3%p 안팎으로 관리하는 여론조사에서 12%p는 해석을 바꿀 수 있는 크기다. 퓨는 공화층과 흑인, 대학을 다니지 않은 사람, 인터넷을 거의 쓰지 않는 사람을 특히 못 맞춘 집단으로 꼽았다. 과거에
한 번 이상 물었던 추세 문항 120여 개도 평균 오차가 12%p로
전체와 같았다. 과거 자료가 많다고 더 잘 맞히지는 못했다.
5. 시의성 현안
여론은 사건이 생기면 빠르게 바뀐다. AI 조사의 매력은 속도지만, 직접 묻지 않고 여론을 추론하는 방식은
빠른 변화를 잡아내기 어렵다. 특히 모델의 학습 시점 이후의 상황에서 실패가 두드러졌다. 이번에 쓴 Claude Opus 4.6의 지식 기준 시점은 2025년 5월이다.
대표적인 예가 대통령 지지율이다. 실제 지지율은 1월 37%, 4월 34%였는데 합성 조사는 두 번 모두 46%였다. 실제 지지율이 이만큼 높았던 마지막 시점은 2기 출범 직후인 2025년 2월(47%)이다. 실제 변화는 대부분 공화층의 지지 하락이었는데, 합성 조사는 공화층
지지율을 두 번 모두 88%로 잡아 4월에는 실제(69%)보다 19%p 높았다.
다른 현안도 비슷했다. 이민단속 요원이 마스크 등으로 신원을 가리는 것을 용인할 수 있다는 응답은 실제 38%, 합성 17%였고, 공화층에서는
실제 67%를 35%로 잡았다. 이란 군사 충돌에서는 합성 공화층이 열에 아홉꼴로 공습을 지지했지만 실제는
3분의 2 정도였다. 데이터센터는 실제 인지도가 '많이 들었다' 25%, '조금'
49%, '전혀' 26%로 고르게 퍼져 있었는데 합성 조사는 94%를 '조금 들었다'에
몰았다. 들어 본 사람 중 데이터센터가 주변 삶의 질에 나쁘다는 응답은 실제 41%, 합성 97%였다.
생활비 걱정은 같은 묶음 안에서 방향이 엇갈렸다. 의료비, 식료품, 주거비는
높게 잡고 휘발유와 전기요금은 낮게 잡았다. 전기요금을 매우 걱정한다는 사람은 실제 52%로 합성 추정치(23%)의 두 배가 넘었다. 같은 조사, 같은 설정에서 어떤 문항은 높게, 어떤 문항은 낮게 나왔고, 사람 조사와 비교해 보기 전에는 어느
쪽인지 알 방법이 없다.
6. 확신과 지식
프롬프트에서 모르는 것이 현실적이라고 분명히
알려 줬는데도 합성 응답자는 '모름'을 훨씬 덜 골랐다. '모름' 보기가 있는 의견 문항에서 사람은 16%, 합성은 4%가 '모름'을 택했다. 보기 하나라도 선택자가
0명인 문항은 사람 조사에는 없었지만 합성 조사에서는 47%였다.
지식 문항
13개에서 사람의 정답률은 평균 절반 정도였고 4분의 3
넘게 맞힌 문항은 없었다. 합성 응답자는 평균 80% 정도를
맞혔고 6개 문항에서 98% 이상이 정답을 골랐다. 틀리는 방식도 달랐다. 모델은 페르소나가 답을 모를 것이라 판단하면
거의 언제나 '모름'을 골랐고 오답을 고르는 일이 거의 없었다. 사람은 모르면 그럴듯한 오답을 고르기도 한다. 지식이나 인지도를
합성 표본으로 추정하는 일은 특히 위험하다.
7. 사라진 다양성
합성 응답자는 집단 안에서 흔한 의견을 거의
전원의 의견으로 만들었다. 퓨는 온라인 텍스트로 학습한 모델이 특정 집단에 대해 고정관념에 기대는 경향과
연결 지었다. 합성 민주층은 80% 이상이 억만장자의 존재가
나라에 나쁘다고 했지만 실제는 45%였고, 실제 민주층의 45%는 좋지도 나쁘지도 않다고 답했다. 합성 공화층은 95%가 이스라엘에 호감이었지만 실제는 58%였다.
Opus 4.6은 대체로 척도 양 끝을 피했다. 트럼프 대통령이 '정직하다', '보통
사람들의 필요를 신경 쓴다' 같은 표현에 '매우 잘' 맞는다고 답한 합성 응답자는 0%였지만 실제로는 적게는 열 명 중
한 명, 많게는 네 명 중 한 명이었다. 하룻밤 수면 시간에서 4시간 이하나 10시간 이상을 고른 합성 응답자는 없었고, 잠들기 어려운 빈도는 98%가 '어떤
날'이나 '드물게'에
몰렸다. 10개국 이상 해외여행 경험은 실제 13%, 합성 1%였다. 다만 이 경향도 일관되지 않아서, 나라의 문제 13개를 묻자 합성 응답자가 사람보다 '매우 큰 문제'를 더 많이 골랐다.
낙태 문항에서 모델은 합법 다수라는 방향은
맞혔다(실제 60%, 합성
62%). 그러나 모든 경우 합법이어야 한다는 23%를
13%로, 모든 경우 불법이어야 한다는 11%를 0%로 만들었다. 찬반 비율이 맞아도 강한 의견을 가진 사람이 사라진
결과는 쟁점의 실제 갈등 수준을 잘못 전한다.
8. 모델을 바꾸면 여론이 바뀐다
퓨는 1월
조사 문항으로 GPT-5.1과 Claude Opus 4.6에게
각각 6,700명을 시뮬레이션하게 했다. 평균 절대오차는 Opus 11.4%p, GPT 13.3%p로 어느 쪽도 잘 맞지 않았고, 두
모델이 오차 5%p 이내로 맞힌 문항은 은퇴계좌 보유 여부 하나를 빼면 겹치지 않았다. 예컨대 1월 대통령 지지율과 이민단속 요원 신원 가림 문항은 GPT가 맞혔고 Opus가 크게 빗나갔다.
그림은 정반대로 갈렸다. GPT는 미국인 100%가 나라 사정에 불만족한다고 추정했고(실제 69%), 낙태에서는 불법 의견이 다수인 거의 반반의 나라를
그렸다. 2024년 트럼프 투표자는 GPT에서 거의 전원이 '매우 강하게' 지지했고 Opus에서는
매우 지지와 어느 정도 지지로 반반 갈렸다. 케네디 보건복지부 장관에 대해 실제 공화층은 74%가 호감이었는데 Opus는 호감 85%, GPT는 비호감 63%로 추정했다.
이 차이는 조사 전체에서 반복됐다. 보기가 순서대로 배열된 89개 문항에서 가운데 보기를 고른 비율은
사람 45%, Opus 56%, GPT 31%였다. GPT는
양 끝 보기를 평균 17%p 과대 추정했고 Opus는 평균 7%p 과소 추정했다. 다른 조건을 모두 같게 두고 모델만 바꿔도
크고 체계적인 차이가 생긴다는 것이 퓨의 결론이다.
9. 검토 의견
이하는 원문 내용이 아니라 정리하면서 확인한
사항과 의견이다.
1.
한 가지 설정의 결과다. 추론 low, 고정
프롬프트, 미세조정 없는 범용 모델이었고 최신 뉴스를 넣어 주는 방식은 시험하지 않았다. 시의성 오차는 그런 방식으로 일부 줄 수 있겠지만, 고정관념 반응, 분포의 단조화, '모름' 회피는
정보 부족보다 모델 성향의 문제여서 같은 방식으로 풀리기 어렵다.
2.
설정을 고른 웨이브(W185)가 최종 평가에도 들어갔다. 설정 선택에 쓰지 않은 W190의 오차가 14.7%p로 가장 컸다는 점은 참고할 만하다. 또 Opus 결과에도 GPT-5.1이 쓴 전문가 성찰이 들어갔으므로 두
모델의 비교는 응답 단계의 차이로 보는 것이 정확하다.
3.
원문에 작은 불일치가 있다. 본문은
12%p 미만 집단이 없다고 했지만 그림의 대졸 이상은 11.9%p이고, 히스패닉 월드컵 시청 의향 실제치가 43%와 42%로 다르게 적혀 있다.
4.
한국에서는 더 어려울 수 있다. 응답자마다
70개 넘는 태도 변수를 미리 가진 확률 패널이 국내에는 흔하지 않다. 퓨만큼 촘촘한 실측
정보를 넣고도 12%p가 틀렸다면, 인구 속성 위주의 페르소나는
그보다 나쁠 가능성이 높다. 영어 중심 학습 자료, 지역·세대·성별을 둘러싼 정형화된 이미지,
빠르게 움직이는 국내 정치 여론도 감안해야 한다.
5.
합성 방식을 쓴다면 응답을 만들어 내는 쪽은 피하는 것이 맞다. 실측 응답을
고정값으로 두고 그 위에서 해석이나 서술을 보태는 방식이 이번 비판에서 비켜나 있다. 다만 그 경우에도 '모름' 비율, 선택자
없는 보기, 양 끝 보기 비율, 집단 내부의 분산, 학습 시점 이후 현안 여부, 다른 모델로 돌렸을 때의 안정성은 실측과
대조해 점검해야 한다.
퓨가 집계 추정을 피하고 응답자 단위 재현을
고집한 것은 국내에서 합성 방식을 평가할 때도 그대로 쓸 수 있는 기준이다. 전체 분포만 맞추면 숫자는
그럴듯해 보인다. 한 사람 한 사람의 응답이 실제와 비슷해서 전체가 비슷해지는지를 봐야 하고, 그 기준으로 볼 때 지금의 범용 언어모델은 정량 응답 생성에서 합격선에 이르지 못했다는 것이 이 보고서의 판정이다.