2026년 9월 11일 금요일

조사 모드가 바뀌면 만족도 점수는 왜 내려가는가

 

조사 모드가 바뀌면 만족도 점수는 왜 내려가는가

공공기관 고객만족도조사(PCSI)의 웹 전환과 미국 HCAHPS의 모드 보정 사례

1. 같은 기관, 같은 문항, 다른 점수

공공기관 고객만족도조사(PCSI)는 기획재정부가 매년 공공기관을 대상으로 실시하고 그 결과를 경영실적평가에 반영하는 조사다. 공기업은 1999, 준정부기관은 2004년부터 시작됐으니 20년이 넘었다. 그 사이 조사 방식은 크게 바뀌었다. 초기에는 면접원이 고객을 직접 찾아가는 대면조사가 주된 방식이었고, 이후 전화조사 비중이 커졌으며, 최근에는 웹조사로 옮겨가는 추세다. 표집틀은 대체로 같다. 해당 기관이 제공하는 고객 명단이다.

명단이 같고 문항이 같은데 모드가 바뀌면 점수가 달라진다. 실무자들 사이에서는 웹조사로 바꾸면 점수가 내려간다는 말이 정설처럼 돌아다닌다. 이 글은 그 현상이 왜 생기는지, 세계적으로 어떻게 확인됐는지, 그리고 기관마다 모드가 다를 때 점수를 어떻게 비교해야 하는지를 다룬다. 후반부에서는 미국 CMS의 병원 환자경험조사(HCAHPS)가 모드 차이를 어떻게 처리해 왔는지를 자세히 소개한다. 경영평가에 연동되는 조사에서 모드 보정을 제도화한 거의 유일한 사례이고, PCSI와 구조가 같기 때문이다.

2. 웹으로 가면 점수가 내려가는 세 가지 이유

점수 하락은 하나의 원인이 아니라 세 가지가 겹친 결과다. 셋을 구분해야 하는 이유는 성격이 다르기 때문이다. 둘은 측정이 좋아진 결과이고, 하나는 새로 생기는 편향이다.

면접원 효과

사람이 묻는 조사에서 응답자는 상대를 의식한다. 특히 "만족하십니까"류 문항에서 그렇다. 눈앞에 있거나 수화기 너머에 있는 면접원에게 "불만족"이라고 말하는 데는 심리적 비용이 든다. 대면에서 가장 크고 전화에서 그다음이며, 웹에서는 혼자 화면을 보고 답하니 이 압력이 거의 사라진다. 만족도 조사는 원래 점수가 천장에 붙어 있는 조사라 이 효과가 빠지면 점수가 눈에 띄게 내려온다.

시각 척도의 중간 수렴

전화에서는 면접원이 척도를 읽어줘야 한다. 11점 척도를 소리로 들으면 응답자는 양 끝이나 "매우 만족" 쪽으로 몰리기 쉽다. 웹에서는 0부터 10까지가 한 줄로 보이니 6, 7, 8점 같은 중간대를 고르는 사람이 늘어난다. 시각 제시 척도에서 중간 수렴이 생긴다는 것은 Dillman과 동료들이 2000년대 초반부터 반복 확인한 패턴이다.

자발 응답자의 불만 편향

명단이 같아도 누가 응답하느냐는 모드에 따라 달라진다. 전화는 면접원이 계속 걸어서 협조율을 끌어올리는 구조이고, 웹은 문자나 메일을 한두 번 보내고 들어오는 사람만 받는다. 협조율이 전화 30~40%에서 웹 10% 안팎으로 떨어지면 남는 응답자는 기관에 뭔가 할 말이 있는 사람 쪽으로 기울기 쉽다. 이건 표집오차가 아니라 무응답 편향이라 표본 수를 늘려도 잡히지 않는다.

그림 1. 전화에서 웹으로 옮길 때 점수가 내려가는 세 요인

앞의 둘은 웹 점수가 "진짜"에 가깝다는 뜻이다. 명단이 같은 사람 집단에게 같은 문항을 묻는데 점수가 내려간다면, 면접원 앞에서 후하게 답하던 부분이 빠진 것이다. 세 번째는 다르다. 응답자 구성이 바뀌어서 생기는 편향이고, 독촉 발송 회차나 인센티브로 협조율을 올리면 줄일 수 있다. 조사기관이 개입할 여지가 있는 부분이다.

PCSI에서는 여기에 한 가지가 더 얹힌다. 경영평가에 직결되는 조사라 기관들이 점수를 적극적으로 관리해 왔다는 점이다. 전화는 언제 걸릴지 모르니 사전 관리가 어렵고, 웹은 발송 시점이 정해져 있어 오히려 개입이 쉬워 보이지만 응답 로그(접속 시각, 소요 시간, 응답 패턴)가 남아서 걸리기도 쉽다. 모드 전환이 그 관리 여지를 줄이는 효과까지 겹치면 하락 폭이 순수한 모드 효과보다 커 보일 수 있다.

3. 한국만의 현상이 아니다

오히려 해외에서 먼저 정리된 현상이고 한국은 그걸 늦게 겪는 쪽이다. 학술적으로는 Dillman과 동료들의 연구가 출발점이다. 2000년대 초 전화와 웹, 우편을 비교한 여러 실험에서 전화 응답이 긍정 극단으로 몰린다는 결과가 반복됐고, 이는 만족도뿐 아니라 태도 문항 전반에서 나타났다. Christian, Dillman, Smyth의 척도 제시 방식 연구가 시각 척도의 중간 수렴을 설명했다.

Dillman (2009)의 실험이 대표적이다. 같은 응답자 집단을 우편, 전화, IVR, 웹에 무작위 배정해 비교했는데, 전화와 IVR 같은 청각 모드에서 척도의 긍정 극단 응답이 우편과 웹 같은 시각 모드보다 일관되게 많았다. 척도를 귀로 듣는 사람은 마지막에 들은 선택지나 가장 긍정적인 선택지를 고르는 경향이 있고, 눈으로 보는 사람은 척도 전체를 훑고 자기 위치를 고른다는 설명이다. 이 차이는 문항 내용과 무관하게 척도 형식 자체에서 나온다.

정부 조사 쪽도 마찬가지다. 미국 ACSI(American Customer Satisfaction Index)는 전화에서 웹 패널로 넘어가는 과정에서 모드 효과를 검증했고, 영국 NHS의 환자조사는 우편에서 온라인으로 옮기면서 점수 하락을 사전에 예고했다. 유럽사회조사(ESS)를 둘러싼 혼합모드 연구(Vannieuwenhuyze Loosveldt, 2010 )와 통계네덜란드(CBS) Klausch, Hox, Schouten 연구는 모드 효과를 측정효과와 선택효과로 분리하는 방법을 발전시켰다.

차이가 있다면 한국은 대면 비중이 유난히 오래 남아 있었다는 점이다. 서구는 대면 만족도 조사가 비용 문제로 1990년대에 이미 거의 사라져서 전화에서 웹으로 한 단계만 겪었는데, PCSI는 대면, 전화, 웹을 20년 안에 다 겪는 셈이라 낙폭이 더 크게 느껴진다.

4. HCAHPS는 어떻게 했나

제도의 구조

HCAHPS(Hospital Consumer Assessment of Healthcare Providers and Systems)는 미국 CMS(메디케어·메디케이드 서비스센터)가 병원 퇴원환자를 대상으로 실시하는 환자경험 조사다. 결과가 병원별로 공개되고 진료비 지급에 연동된다. 경영평가에 연동되는 PCSI와 구조가 같다. 다만 한 가지가 다르다. 병원이 조사 모드를 스스로 고를 수 있다. 우편, 전화, 우편 후 전화 추적(혼합), 능동형 IVR 네 가지 중 하나를 선택한다. 기관마다 모드가 다른 상황이 처음부터 제도에 내장돼 있었고, 그래서 보정이 필수였다.

2006년 무작위 모드 실험

CMS는 본조사 공표에 앞서 실험을 했다. 무작위로 추출한 45개 병원 안에서 27,229명의 환자를 네 모드에 무작위 배정한 것이다. 병원이 모드를 고르는 게 아니라 환자를 병원 안에서 무작위로 나눴다는 점이 중요하다. 병원의 질과 모드 선택이 얽혀 있으면 관찰 데이터로는 모드 효과를 분리할 수 없기 때문이다.

결과는 명확했다. 전화와 IVR 응답자가 우편과 혼합 응답자보다 일관되게 긍정적으로 평가했고, 일부 항목의 차이는 병원 순위 30퍼센타일 이상에 해당하는 크기였다. 모드 효과는 병원 간에 일관됐고 환자 구성(patient-mix) 효과 전체보다 대체로 컸다. 응답률도 모드별로 크게 달라 혼합 41.2%에서 IVR 20.7%까지 벌어졌다. 이 결과는 Elliott (2009) Health Services Research에 발표했다.

한국식으로 옮기면 이렇다. 면접원이 개입하는 모드가 자기기입식보다 점수를 높이며, 그 차이는 응답자 특성 차이보다 크다. 그리고 그 차이는 기관마다 크게 다르지 않아서 공통 계수로 보정할 수 있다.

보정 방식

CMS는 측정항목마다 회귀모형을 돌린다. 각 항목 점수를 모드 변수, 환자 구성 변수, 병원 고정효과에 회귀시켜 모드 계수를 추정하고, 그 계수에 -1을 곱한 값을 보정치로 쓴다. 기준 모드는 우편이다. 점수가 낮게 나오는 자기기입식을 기준으로 삼고, 면접원 모드의 점수를 깎는 방향이다.

그림 2. HCAHPS 전화 모드 보정값(2016년 실험, 상위응답 비율 기준). 출처: hcahpsonline.org

그림 2 2016년 실험에서 도출한 전화 모드 보정값이다. 병원 조용함 항목은 전화 응답에서 8.6%p를 빼고, 간호사 소통은 4.2%p, 병원 전체 평점은 2.0%p를 뺀다. 문항 성격에 따라 격차가 1%p에서 9%p까지 벌어진다는 것을 알 수 있다. 전체 점수에 하나의 계수를 적용하는 게 아니라 문항별로 다른 계수를 쓰는 이유다.

운영 원칙도 눈여겨볼 만하다. 보정계수는 공표 데이터에 따라 달라지지 않고 무작위 실험에서만 도출한다. 매 분기 새로 추정하는 게 아니라 실험으로 확정한 값을 고정해 쓴다는 뜻이다. 그리고 보정 전 점수, 보정계수, 보정 방법론 문서를 모두 hcahpsonline.org에 공개한다. 병원이 자기 점수가 어떻게 계산됐는지 따라갈 수 있다.

왜 우편을 기준으로 삼았는지도 생각해 볼 만하다. 가장 많은 병원이 쓰는 모드라서가 아니다. 면접원이 없는 모드가 응답자의 평가를 가장 덜 부풀린다고 봤기 때문이다. 기준 모드를 어디에 두느냐는 기술적 선택처럼 보이지만 사실은 어느 점수를 "진짜"로 볼 것인가에 대한 판단이다. 전화를 기준으로 잡고 우편 점수를 올리는 방식도 수학적으로는 가능하다. CMS는 그 반대를 택했다.

실험을 반복해 갱신한다

2006년 실험으로 2008년 첫 공표부터 보정을 시작한 뒤, CMS 2016년에 다시 실험해 계수를 갱신했고, 2021년에 또 실험해 2023 1월 퇴원 환자부터 새 보정값을 적용했다. 2021년 실험은 46개 병원, 36,000명 이상의 환자를 대상으로 했다. 응답 행태는 시간이 지나면 바뀌니 계수도 주기적으로 다시 재야 한다는 판단이다.

웹 모드의 도입

PCSI 상황과 가장 직결되는 대목은 웹 모드다. HCAHPS 2.0 2025 1월 퇴원 환자부터 이메일 후 우편, 이메일 후 전화, 이메일 후 우편·전화 세 가지 웹 우선 모드를 새로 도입했다. 기존 우편·전화·혼합 모드도 그대로 유지되니 여섯 모드가 공존한다. 2021년 실험은 기존 모드와 새 웹 우선 모드에 모두 적용할 수 있는 보정값을 산출하도록 설계됐고, 웹 우선 모드의 보정값은 모드 출시와 함께 적용됐다.

그림 3. HCAHPS 2021년 모드 실험의 모드별 응답률. 출처: AHRQ CAHPS 웨비나(2024.1)

그림 3 2021년 실험의 응답률이다. 우편 22%, 전화 23%, 우편 후 전화 31%였고, 웹을 앞에 붙인 모드는 웹 후 우편 29%, 웹 후 전화 30%, 웹 후 우편·전화 36%로 응답률이 올라갔다. 웹이 단독으로는 응답률이 낮지만 다른 모드 앞에 붙이면 전체 응답률을 끌어올린다는 것이다. 한국의 문자 발송 웹조사에도 시사하는 바가 있다. 웹 무응답자에게 전화를 붙이는 혼합 설계가 응답자 구성 편향을 줄이는 현실적인 방법이 될 수 있다.

5. 기관별 모드가 다를 때 비교하는 방법

어느 기관은 전화로, 어느 기관은 웹으로 조사했을 때 점수를 비교하려면 어떻게 해야 하는가. 방법은 크게 네 갈래다.

방법

내용

장점

약점

병행조사

일부 기관의 명단을 무작위로 갈라 두 모드로 동시에 조사해 격차를 잰다

단순하고 설명이 쉽다

격차가 기관마다 다를 수 있다

회귀 보정

점수를 모드와 응답자 특성, 기관 고정효과에 회귀시켜 모드 계수를 추정하고 기준 모드로 환산한다

HCAHPS가 공식 채택. 문항별 계수 산출 가능

무작위 실험 데이터가 있어야 신뢰할 수 있다

재면접 설계

웹 응답자 일부를 전화로 다시 조사해 같은 사람의 두 모드 응답을 비교한다

측정효과와 선택효과를 분리한다

비용이 크고 응답자 부담이 있다

모드 내 상대평가

같은 모드로 조사한 기관끼리만 등급을 매긴다

보정 자체가 필요 없다

절대점수 공표를 포기해야 한다

 

HCAHPS는 첫째와 둘째를 결합했다. 무작위 병행 실험으로 데이터를 만들고, 그 데이터에 회귀모형을 적용해 문항별 계수를 도출했다. 셋째는 통계네덜란드 연구진이 발전시킨 방법으로, 학술적으로 가장 깨끗하지만 한 사람에게 두 번 묻는 것 자체가 응답을 바꿀 수 있고 비용이 크다. 넷째는 PCSI가 이미 유사기관 그룹별 상대평가를 하고 있으니 그룹을 모드까지 맞춰 짜면 되는 방식인데, 절대점수 공표를 포기해야 하니 제도 취지와 맞지 않는다.

이 밖에 잠재변수 접근도 있다. PCSI가 구조방정식 모형 기반이니 다집단 확인적 요인분석으로 모드 간 측정동일성을 검증하고 요인 점수 수준에서 비교하는 방식이다. Hox, de Leeuw, Zijlmans(2015)가 혼합모드 측정동일성을 다뤘다. 학술적으로는 맞는 접근이지만 경영평가 실무에서 기관에 설명하기 어렵다.

6. PCSI에 적용한다면

현실적인 조합은 HCAHPS와 같다. 병행조사로 격차를 재고 회귀보정으로 환산하는 두 단계다.

1단계는 격차 추정이다. 유사기관 그룹별로 상··하 점수대에서 한 곳씩, 전체 10개 안팎 기관을 골라 고객 명단을 무작위로 갈라 전화와 웹으로 동시에 조사한다. 기관당 모드별 200명이면 100점 척도 기준 표준오차가 1점 안쪽이라 2~3점 차이는 잡힌다. 4,000명 정도이고, 이 중 웹 2,000명은 본조사에 그대로 포함되니 순증 비용은 전화 2,000명분이다. 점수대를 섞어야 하는 이유는 상위 기관만 넣으면 천장효과 때문에 격차가 과대추정되고, 그 계수를 중하위 기관에 적용하면 과보정이 되기 때문이다.

2단계는 적용이다. 병행조사 데이터로 문항별·기관유형별 모드 계수를 추정하고, 전화로 조사한 기관 점수를 웹 기준으로 환산해서 공표한다. 기준은 웹이어야 한다. 앞으로 남을 모드가 웹이고, 면접원 효과가 빠진 쪽이 측정으로도 낫다. 환산 전 점수와 계수를 함께 공개하면 기관이 자기 점수를 따라갈 수 있다. HCAHPS가 그렇게 하고 있다.

주의할 점이 있다. HCAHPS의 보정은 측정효과를 잡는 것이지 응답자 구성 편향(앞의 세 번째 요인)까지 잡는 것은 아니다. 환자 구성 변수를 모형에 넣어 일부 통제하지만, 웹 협조율이 낮아서 생기는 무응답 편향은 보정계수가 아니라 실사 설계로 다스려야 한다. 리마인더 회차, 발송 시간대, 인센티브, 그리고 웹 무응답자에 대한 전화 추적 같은 것들이다. 보정과 실사 관리는 다른 문제이고, 둘 다 필요하다.

한 기관의 시계열은 어떻게 잇는가

기관 간 비교와 별개로 한 기관의 전년 대비 변화를 보는 문제가 있다. 작년에 전화로 91, 올해 웹으로 87점이 나왔을 때 4점 하락 중 얼마가 모드 때문인지를 알아야 한다. 방법은 같다. 전환 첫해에 그 기관의 명단 일부를 전화로도 조사해서 두 모드 점수를 같이 확보하면 된다. 전화 점수는 작년과 잇고, 웹 점수는 내년 이후와 잇는다. 통계기관이 조사 방식을 바꿀 때 하는 가교조사(bridge study)가 바로 이것이고, 미국 센서스국이나 영국 ONS가 우편에서 웹으로 옮길 때 예외 없이 거친 절차다.

이걸 놓치면 시계열이 끊긴다. 몇 년 뒤에 소급해서 추정할 방법이 없다. 그래서 모드를 바꾸는 해에 병행조사를 하는 것은 선택이 아니라 시계열을 보존하는 최소 조건이다. 기관 하나하나가 다 할 수는 없으니, 앞서 말한 10개 안팎 기관의 병행조사 결과를 유사기관 그룹의 공통 가교값으로 쓰는 것이 현실적이다.

척도 환산과 모드 효과가 겹칠 때

PCSI는 척도 점수를 100점 만점으로 환산해 공표한다. 환산식에 따라 모드 효과가 다르게 보일 수 있다. 0~10 11점 척도를 (평균/10)×100으로 환산하면 원점수 1점 차이가 10점 차이로 커진다. 웹에서 응답이 중간대로 수렴해 평균이 0.3점 내려가면 공표 점수는 3점 내려간다. 척도 끝점의 정의(0점이 실제로 "전혀 만족하지 않음"인지, 척도에 원점이 있는지)도 환산 결과에 영향을 준다. 모드 보정계수를 원점수 단위로 추정할지 환산 점수 단위로 추정할지를 미리 정해야 하고, HCAHPS는 항목별 상위응답 비율(top box)과 선형 평균 두 가지 단위로 각각 계수를 낸다.

7. 국내에 없는 것

국내 레퍼런스는 빈약하다. 통계청 통계개발원이 혼합모드 조사 관련 연구를 낸 적이 있고 인구주택총조사에 인터넷 조사를 병행하면서 모드 검토를 했지만, 만족도 조사에서 모드 보정을 공식화한 사례는 없다. NCSI KS-SQI 같은 민간 지수도 모드를 바꾸면서 보정식을 공개한 적이 없다. PCSI도 모드가 바뀌는 동안 전년 대비 점수를 그냥 비교해 왔다.

기관 입장에서 전년 대비 하락이 모드 변경 때문인지 서비스 저하 때문인지 구분이 안 된다는 것이 실제 문제다. 전환 시점에 일부 표본을 병행 조사해서 모드 격차를 추정해 두면 시계열 보정이 가능한데, 이걸 안 하고 넘어간 기관이 대부분일 것이다. 조사기관이 할 일이 여기 있다. 기관이 사전 진단 조사를 의뢰한다면 본조사와 같은 웹 모드로 돌려서 실제 받을 점수대를 예측해 주는 것이 의미가 있다. 전화로 사전조사해서 92점이 나왔는데 본조사 웹에서 86점이 나오면 사전조사는 아무 도움이 안 된다.

모드 효과는 조사의 결함이 아니라 조사의 속성이다. 미국 CMS 2006년 실험으로 이 문제를 인정하고 20년 가까이 보정계수를 공개해 온 것은, 점수 하나를 공표하는 데 그 점수가 어떻게 만들어졌는지를 같이 설명해야 한다는 태도 때문이다. 한국의 공공기관 만족도조사에도 그 태도가 필요한 시점이다.

참고문헌

Elliott, M. N., Zaslavsky, A. M., Goldstein, E., Lehrman, W., Hambarsoomian, K., Beckett, M. K., & Giordano, L. (2009). Effects of survey mode, patient mix, and nonresponse on CAHPS hospital survey scores. Health Services Research, 44(2), 501–518. (PMC2677051)

CMS (2008). Mode and Patient-mix Adjustment of the CAHPS Hospital Survey (HCAHPS), April 30, 2008. hcahpsonline.org

CMS (2017). HCAHPS Survey Mode Adjustments of Top Box and Bottom Box Percentages, Derived from 2016 Mode Experiment. hcahpsonline.org

CMS (2024). Mode Adjustments for HCAHPS Survey Beginning with January 2025 Discharges. hcahpsonline.org

Elliott, M. N. (2024). 2021 HCAHPS Mode Experiment: Design and Results. AHRQ CAHPS Research Webcast, January 2024.

Dillman, D. A., Phelps, G., Tortora, R., Swift, K., Kohrell, J., Berck, J., & Messer, B. L. (2009). Response rate and measurement differences in mixed-mode surveys using mail, telephone, interactive voice response (IVR) and the Internet. Social Science Research, 38(1), 1–18.

Christian, L. M., Dillman, D. A., & Smyth, J. D. (2008). The effects of mode and format on answers to scalar questions in telephone and web surveys. In Lepkowski et al. (Eds.), Advances in Telephone Survey Methodology. Wiley.

Vannieuwenhuyze, J., Loosveldt, G., & Molenberghs, G. (2010). A method for evaluating mode effects in mixed-mode surveys. Public Opinion Quarterly, 74(5), 1027–1045.

Klausch, T., Hox, J. J., & Schouten, B. (2013). Measurement effects of survey mode on the equivalence of attitudinal rating scale questions. Sociological Methods & Research, 42(3), 227–263.

Schouten, B., van den Brakel, J., Buelens, B., van der Laan, J., & Klausch, T. (2013). Disentangling mode-specific selection and measurement bias in social surveys. Social Science Research, 42(6), 1555–1570.

Hox, J. J., de Leeuw, E. D., & Zijlmans, E. A. O. (2015). Measurement equivalence in mixed mode surveys. Frontiers in Psychology, 6, 87.

Kolenikov, S., & Kennedy, C. (2014). Evaluating three approaches to statistically adjust for mode effects. Journal of Survey Statistics and Methodology, 2(2), 126–158.

이청림, 이유재 (2012). 공공기관 고객만족지수 모형의 개발과 적용. 마케팅연구, 27(4), 69–99.

2026년 9월 10일 목요일

거대 플랫폼의 "돈 버는 서베이"와 자기선택 편향

거대 플랫폼의 "돈 버는 서베이"와 자기선택 편향

이용자 수천만의 앱에서 돌리는 설문이 왜 대표성을 갖지 못하는가

2026 9 10일 오후, 내 휴대전화에 깔린 앱 세 개를 차례로 열어 보았다. 카카오뱅크에는 "돈 버는 서베이", T멤버십에는 "돈 버는 설문", 패스에는 "설문앱테크"가 있었다. 셋 다 같은 말을 한다. 설문에 참여하고 용돈을 벌라는 것이다. 토스, 하나 같은 금융 앱에도 같은 메뉴가 붙어 있다. 몇 년 전만 해도 패널 회사의 전용 앱에서나 보던 화면이 이제 국민 대부분이 매일 여는 앱의 한 탭이 되었다.

이 글은 그 화면들을 조사방법론 관점에서 읽어 본 것이다. 결론부터 말하면, 플랫폼의 이용자 수가 아무리 커도 이 방식으로 모인 응답은 심각한 자기선택 편향을 안고 있으며, 그 편향은 흔히 쓰는 인구 변수 가중으로는 걷어낼 수 없다.

1. 화면에 무엇이 있었나

그림 1. 왼쪽부터 카카오뱅크 "돈 버는 서베이", T멤버십 "돈 버는 설문", 패스 "설문앱테크" (2026-09-10 캡처)

세 앱의 화면을 항목별로 정리하면 다음과 같다.

플랫폼

메뉴명

형태

소요·보상

비고

카카오뱅크

돈 버는 서베이

제휴 설문

10, 800

패널사 라우팅으로 보임

카카오뱅크

돈 버는 서베이

기본 정보

20~40, 2~4

구강케어·스마트워치·외식 등 프로파일링 문항

T멤버십

돈 버는 설문(퀵서베이)

자체 퀵서베이

10P

1주 게시, 참여 인원 마감 표시

패스

서베이(설문앱테크)

나만의 설문

8, 20~400P

설문명이 고객사 코드(SM-BLS), 조건별 차등 지급

패스

서베이(설문앱테크)

나만의 설문

2, 30~90P

동일 구조(LM-RH)

1. 세 플랫폼의 설문 메뉴 구성 (2026-09-10 기준)

구조가 조금씩 다르다. 카카오뱅크는 외부 패널사의 설문을 "제휴 설문"으로 받아 10분에 800원을 주고, 그 사이사이에 20초짜리 "기본 정보" 문항을 2원에 끼워 넣는다. 어떤 구강케어 제품을 쓰는지, 어떤 스마트워치를 차는지, 등산을 즐기는지 묻는 문항들이다. 이것은 조사가 아니라 프로파일 수집이다. 응답자 한 명의 소비 속성을 2원에 사 모아 두었다가 다음 제휴 설문의 타겟팅에 쓴다.

T멤버십은 자체 퀵서베이를 1주 단위로 게시하고 10P를 준다. 캡처 시점에 두 건 모두 "참여 인원 마감" 상태였다. 패스는 패널사의 라우팅 화면을 그대로 앱 안에 넣은 것으로 보인다. 설문명이 "일반인 의견 조사(SM-BLS)"처럼 고객사 코드로 표시되고, 보상은 "대상자 조건에 따라 자동지급"이라며 20~400P의 폭을 둔다. 이 앱 안에서 돌아가는 조사는 B2B 패널 물량이다.

2. 왜 이렇게 싸고, 왜 이렇게 빨리 마감되나

단가부터 보자. 10분에 800원이면 시급 4,800원이다. 2026년 최저임금의 절반이 안 된다. 20초에 2원은 시급으로 환산하면 360원이다. 그런데도 T멤버십의 퀵서베이는 게시 며칠 만에 인원이 찼다. 카카오뱅크 화면 위쪽에는 "추천 서베이 도착! 놓치지 마세요"라는 문구가 떠 있다. 놓칠까 봐 걱정해야 할 만큼 응답자가 몰린다는 뜻이다.

이 두 사실은 같은 것을 가리킨다. 응답자 공급이 넘친다. 공급이 넘치니 보상이 이 수준까지 내려왔고, 보상이 이 수준인데도 마감이 난다. 앱 사업자는 이용자의 체류시간과 프로파일 데이터를 얻고, 패널사는 리쿠르팅 비용을 아끼고, 응답자는 푼돈을 받는다. 세 당사자 모두에게 남는 장사이므로 이 방식은 당분간 계속 늘어날 것이다.

문제는 "참여 인원 마감"을 어떻게 읽느냐다. 발주자는 이것을 응답자가 많다는 신호로 읽고 싶어 한다. 그러나 같은 사람들이 빠르게 몰린다는 신호로 읽는 것이 맞다. 시급 5천원 아래에서 10분을 내놓는 사람이 누구인지 생각하면, 마감 속도는 표본의 폭이 아니라 표본의 좁음을 보여주는 지표다.

3. 모집단이 커도 표본은 커지지 않는다

"카카오뱅크 이용자 2천만 명이 응답할 수 있다"는 설명은 분모 이야기다. 응답이라는 행위는 분자에서 일어난다. 카카오뱅크를 깔았다는 것과, 혜택 탭에 들어가서, "서베이 참여하고 현금 받기"를 누르고, 20초짜리 문항을 2원에 찍는다는 것은 전혀 다른 일이다. 앞의 집단은 국민 대부분이지만 뒤의 집단은 따로 있다. 앱테크에 시간을 쓸 만큼 자기 시간의 값이 싼 사람, 그리고 이런 것을 찾아다니는 성향의 사람이다.

모집단이 커진다고 자기선택이 희석되지는 않는다. 분모만 커지고 실제 응답 집단은 그대로다. 겉으로 보이는 플랫폼 규모와 표본의 대표성은 서로 관계가 없다. 이 점에서 거대 플랫폼의 앱테크 설문은 패널 회사의 전용 앱보다 나을 것이 없고, 어떤 면에서는 더 나쁘다. 전용 앱은 최소한 가입 시점에 패널 관리라는 절차를 거치지만, 금융 앱의 서베이 탭은 그런 절차 없이 누구나 즉시 들어와 찍고 나간다.

이 편향의 크기는 주제에 따라 다르다. 앱테크 성향과 관계없는 주제, 예를 들어 좋아하는 라면 맛 같은 것은 큰 문제가 안 될 수 있다. 그러나 소비 여력, 금융 행동, 시간 사용, 노동 형태, 정치 관심 같은 주제는 앱테크 성향과 상관이 크다. 하필 금융 앱에서 돌리는 설문의 고객사가 가장 알고 싶어 하는 것이 바로 그런 주제들이다.

4. 가중치가 잡지 못하는 것

여기서 흔한 반론이 나온다. 성별, 연령, 지역을 맞춰 가중하면 되지 않느냐는 것이다. 되지 않는다. 가중은 응답자를 인구 셀에 넣고 셀별 비중을 맞추는 작업이다. 30대 남성 직장인 칸에 들어간 응답자는 30대 남성 직장인 전체를 대표하는 것이 아니라, 그중 앱테크를 하는 30대 남성 직장인만 대표한다. "설문 앱을 켜는 사람"이라는 속성은 인구 변수가 아니므로 가중 셀 안에 그대로 남는다.

가중이 작동하려면 조건이 하나 필요하다. 응답 여부가 가중 변수만으로 설명되고, 가중 변수가 같으면 응답자와 비응답자의 답이 같아야 한다. 이것을 무시 가능한 비응답(ignorable nonresponse) 가정이라 부른다. 앱테크 설문에서 이 가정은 처음부터 깨져 있다. 응답을 결정하는 것은 성별과 연령이 아니라 시간의 기회비용과 앱테크 성향이고, 이 둘은 조사 주제와 직접 얽혀 있다.

그래서 이 방식의 조사에서 "가중 후 결과"라는 표현은 안심의 근거가 되지 못한다. 가중은 인구 구성의 착시를 고쳐 줄 뿐이고, 진짜 편향은 각 셀 안에 그대로 있다. 가중 배율이 크게 벌어져 있다면 셀 안의 편향에 더해 분산까지 커진 것이다.

5. 보상 설계가 편향을 굳힌다

보상 방식 자체가 편향을 키우는 방향으로 짜여 있다. 첫째, 보상이 낮아질수록 남는 사람은 더 좁아진다. 800원에 10분을 내놓는 사람과 8,000원에 10분을 내놓는 사람은 다른 집단이다. 시급이 내려갈수록 응답 집단은 소득과 시간 여유가 특정한 방향으로 쏠린다.

둘째, "대상자 조건에 따라 20~400P"라는 차등 지급은 조건에 맞추려는 유인을 만든다. 스크리닝에서 탈락하면 20P, 통과해서 본설문까지 가면 400P라면, 응답자는 어떤 답이 통과되는지 금세 배운다. 실제로 그 제품을 쓰지 않아도 쓴다고 답하는 것이 합리적인 선택이 된다. 자기선택 위에 응답 왜곡이 얹힌다.

셋째, 같은 사람이 여러 앱에 동시에 가입해 있다. 내 휴대전화에도 세 개가 깔려 있었다. 같은 고객사의 조사가 여러 앱으로 라우팅되면 한 사람이 같은 조사에 두세 번 응답하는 것을 막을 방법이 없다. 패널사는 자사 패널 안에서만 중복을 관리할 수 있고, 플랫폼 간 중복은 누구도 관리하지 않는다.

넷째, 카카오뱅크의 "기본 정보" 문항은 프로파일링을 통해 다음 조사의 대상자를 미리 좁힌다. 편의상으로는 좋은 일이지만, 이미 좁은 응답 집단을 다시 프로파일로 잘라 쓰는 것이므로 표본은 조사 회차를 거듭할수록 더 특정한 사람들로 굳어진다.

6. 어디에 쓸 수 있고 어디에 못 쓰나

이 방식이 아무 쓸모가 없다는 말은 아니다. 속도와 비용은 압도적이다. 신제품 컨셉의 상대 비교, 광고 시안의 선호, 이름 후보의 반응처럼 절대 수준보다 대안 간 상대 순위가 중요한 조사에는 쓸 만하다. 응답 집단이 치우쳐 있어도 그 치우침이 모든 대안에 같은 방향으로 작용한다면 순위는 크게 흔들리지 않는다.

반면 절대 수준을 읽어야 하는 조사에는 쓸 수 없다. 국민의 몇 퍼센트가 어떤 의견인지, 어떤 정책에 찬성이 우세한지, 어떤 상품의 이용률이 얼마인지를 묻는 조사가 그렇다. 여론조사는 말할 것도 없고, 이용 실태나 인식 수준을 수치로 보고하는 정책조사, 시장조사도 이 방식으로는 안 된다. 그 수치가 대표하는 집단이 "앱테크를 하는 사람들"이라는 것을 보고서에 명시하지 않는 한 그렇다.

대비되는 방식은 조사자가 응답자를 고르는 접근이다. 통신사 가입자 DB처럼 모집단에 가까운 명부에서 조건에 맞게 뽑아 먼저 문자를 보내고, 응답할지 말지는 받은 사람이 정한다. 응답률은 앱테크 설문보다 훨씬 낮다. 그러나 접촉 대상이 애초에 무작위에 가깝기 때문에 비응답 편향은 다룰 수 있는 문제가 된다. 응답자가 조사를 고르는 것과 조사가 응답자를 고르는 것은 응답률로 비교할 수 없는 다른 방식이다.

7. 물어야 할 질문을 바꾸기

발주자가 조사 결과를 받을 때 보통 첫 질문은 "몇 명이 응답했느냐". 앱테크 설문에서 이 숫자는 언제나 넉넉하다. 그래서 이 숫자는 아무것도 말해 주지 않는다. 물어야 할 질문은 "누가 응답하지 않았느냐". 카카오뱅크 이용자 2천만 명 중 이 서베이 탭을 한 번도 열지 않은 사람들이 어떤 사람인지, 그들이 조사 주제에 대해 응답자와 다른 답을 갖고 있을 가능성이 얼마나 되는지가 결과의 신뢰도를 정한다.

이용자 규모가 큰 플랫폼일수록 이 질문을 피하기 쉽다. 숫자가 크면 대표성이 따라온다는 착각이 있기 때문이다. 그러나 이 글에서 본 세 화면은 반대를 보여준다. 분모가 아무리 커도 분자는 시급 5천원에 시간을 파는 사람들로 채워지고, 그 사실은 가중치로 지워지지 않으며, 보상 설계는 그 집단을 더 좁고 더 굳게 만든다. 플랫폼이 거대하다는 것과 표본이 대표적이라는 것은 별개의 문제다.


통계청 조사통계의 통계

  통계청 조사통계의 통계 국가승인 조사통계 607 종을 세어 보았다 오승호 · 2026 년 9 월 들어가며 국가데이터처 ( 옛 통계청 ) 는 승인통계 목록을 파일로 내려받을 수 있게 공개한다 . 2026 년 9 월 17...