LLM이 코딩하고 사람이 검증한 내용분석
퓨 리서치 「건강·웰니스
인플루언서는 무엇을 올리나」 보고서와 그 방법론 읽기
오승호 · 2026년 10월
퓨
리서치 센터 데이터랩스(Data Labs)가 2026년 10월 7일 「What Do
Health and Wellness Influencers Post About?」를 냈다. 인스타그램·틱톡·유튜브에서 활동하는 미국 건강·웰니스
인플루언서 6,334명이 2026년 2월 1일부터 4월 30일까지 올린 게시물 535,512건을 분석한 보고서다.
이
보고서는 5월 7일에 나온
1차 보고서의 후속편이다. 1차에서는 팔로워 10만
명 이상인 인플루언서 6,828명을 찾아 소셜미디어 자기소개를 분류했고, 미국 성인 패널(ATP) 조사 두 차례(2025년 6월 5,023명, 10월 5,111명)로
사람들이 이들에게서 어떤 정보를 얻는지 물었다. 1차가 인플루언서가 누구인지, 수용자가 무엇을 듣는다고 답하는지를 다뤘다면 2차는 같은 인플루언서들이
실제로 무엇을 올렸는지를 게시물 단위로 쟀다.
조사를
하는 입장에서 이 보고서가 눈에 들어온 이유는 결과보다 방법이다. 내용분석은 오래된 방법이지만, 이번 보고서는 코딩을 LLM(GPT-5.4 Mini)에 맡기고 사람
코더가 만든 검증셋으로 모델 성능을 재서 라벨별 수치를 공개했다. 분류에 쓴 지시문(프롬프트)과 출력 스키마도 함께 냈다. 사람이 코딩하고 코더 간 일치도를 보고하던 내용분석이 모델이 코딩하고 사람이 검증하는 방식으로 바뀌고 있는데, 퓨가 그 절차를 공식 보고서의 방법론 문서로 정리해 보인 셈이다.
글의
앞부분은 보고서 결과를 소개하고, 뒷부분은 분석 절차와 방법론에서 따져볼 대목을 정리한다. 뒷부분의 보정값은 퓨가 공개한 검증 지표로 필자가 다시 계산한 것이며 퓨의 공식 수치가 아니다.
1. 보고서가 찾은 것
게시물의 절반 이상은 생활 건강 이야기였다
퓨는 13개 주제를 생활 건강(healthy living)과 의료(medical issues) 두 묶음으로 나눴다. 생활 건강에는 피트니스, 건강 습관, 영양, 외모
관리, 일반의약품·보충제,
장수가 들어가고, 의료에는 질병, 전문 치료(처방이나 의료인의 시술이 필요한 것), 질병·의료 경험담, 정신건강, 여성
건강, 남성 건강이 들어간다. 보건정책은 어느 쪽에도 넣지
않았다.
전체
게시물의 54%가 생활 건강 주제를, 34%가 의료 주제를
하나 이상 언급했다. 개별 주제로는 피트니스가 25%로 가장
많았고 건강 습관(20%), 영양(19%), 질병(19%)이 뒤를 이었다. 가장 적은 주제는 남성 건강(1%)이었다. 게시물의 30%는
건강과 관계없는 내용이었다. 인플루언서의 일상이나 다른 관심사를 다룬 게시물들로, 이런 게시물을 한 번이라도 올린 인플루언서가 89%였다.
한
게시물에 여러 주제가 겹치는 경우도 많았다. 게시물의 45%가
두 개 이상의 주제를 언급했고, 19%는 의료 주제와 생활 건강 주제를 함께 다뤘다. 영양 게시물의 42%는 단백질을 직접 언급했다.
질병을
언급한 게시물만 따로 보면 암이 8.5%로 가장 자주 나왔고 불안·우울(7.5%), 당뇨·전당뇨(7.2%),
중독·약물남용(5.4%), ADHD(5.1%) 순이었다. 보고서가 제시한 질환 가운데 가장 적은 것은 인슐린 저항성과 다낭성난소증후군(PCOS)으로
각각 3.2%였다.
그림 1

인플루언서 열에 여섯은 주력 주제가 있었다
퓨는
인플루언서별로 가장 많이 다룬 주제가 두 번째 주제보다 30% 이상 많은 게시물에서 언급되면 그것을
주력 주제로 정했다. 이 기준으로 약 60%가 주력 주제를
가졌다. 피트니스가 25%로 가장 많았고 영양(10%), 정신건강(5%)이 뒤를 이었으며, 39%는 한 주제에 쏠리지 않았다. 질병은 전체 게시물의 19%에 나올 만큼 흔했지만 질병을 주력으로 삼은 인플루언서는 4%였다. 많은 인플루언서가 질병을 가끔씩 언급한다는 뜻이다.
가장
많이 다룬 두 주제의 조합은 피트니스와 건강 습관이 17%로 가장 흔했고 건강 습관과 영양이 8%로 다음이었다. 외모 관리와 전문 치료의 조합도 7%였는데, 지방흡입이나 안면거상 같은 시술을 소개하는 성형외과 의사
계정들이 여기에 들어간다.
게시물 열에 넷 가까이에 홍보가 들어 있었다
게시물의 38%가 협찬을 밝히거나 제품·서비스·구독 이용을 권했다. 건강 주제를 직접 다룬 게시물만 보면 절반에
가깝다. 퓨는 홍보를 넓게 잡았다. 협찬 표기가 없어도 구매나
구독을 권하면 홍보로 봤고, 무료 식단표나 운동 가이드를 권하는 것도 포함했다.
주제별
홍보 비율은 일반의약품·보충제 게시물이 66%로 가장 높았고
보건정책 게시물이 29%로 가장 낮았다. 인플루언서 단위로
보면 92%가 석 달 동안 한 번 이상 홍보 게시물을 올렸고, 33%는
게시물의 과반에 홍보를 넣었다. 게시물 과반에 홍보를 넣는 인플루언서 비율은 영양사(43%)가 가장 높았고 활동가(19%)가 가장 낮았다.
건강
위해를 경고한 게시물은 11%, 외부 출처를 근거로 들며 건강 주장을 한 게시물은 9%였다. 출처를 인용한 게시물의 열에 넷 정도는 위해 경고도 함께
담았다. 주제별 경고 비율은 보건정책 게시물이 46%로 가장
높았고 피트니스 게시물이 8%로 가장 낮았다. 그림 2처럼 홍보가 잦은 주제와 경고가 잦은 주제는 대체로 다르다. 외모
관리 게시물은 홍보가 56%로 높은 편인데 경고는 10%에
그쳤고, 보건정책은 경고가 홍보보다 많은 유일한 주제였다.
그림 2

의료 이야기는 주로 의료인이 했다
보고서의
두 번째 장은 누가 어떤 주제를 올리는지 본다. 인플루언서의 배경은
1차 보고서에서 소셜미디어 자기소개를 분류해 정했다. 일반 의료인(의사·간호사 등)의 게시물은
전문 치료를 38%, 질병을 30% 다뤘고, 질병 언급이 가장 많은 배경은 보완·대체·통합의학 종사자(35%)였다. 의료
자격을 내세우지 않는 집단에서는 질병 이야기가 드물어서 운동선수는 7%, 코치는 11%에 머물렀다. 아무 자격도 밝히지 않은 인플루언서(전체의 16%)의 게시물도 질병 언급은 12%였다.
자기
전공을 따라가는 경향도 뚜렷했다. 영양 게시물 비율은 영양사가 52%로
가장 높았고, 정신건강 게시물 비율은 정신건강 전문가가 36%로
가장 높았다. 피트니스는 운동선수(50%)가 가장 높았고
코치(43%)가 다음이었다. 외부 출처 인용은 연구자를 표방한
인플루언서가 30%로 가장 많았고 코치·운동선수·무자격 집단이 5%로 가장 적었다.
성별로
보면 대부분의 주제에서 남녀 차이가 크지 않았지만 성별 건강 주제는 달랐다. 여성 건강을 한 번이라도
다룬 비율은 여성 인플루언서가 58%, 남성이 30%였고, 남성 건강은 남성 24%, 여성
7%였다. 남성 인플루언서 사이에서도 여성 건강을 다룬 비율이 남성 건강보다 높았다. 여성 건강 게시물의 다섯에 하나 정도는 폐경과 그 전후 시기를 다뤘다. 그
밖에 장수는 남성(41%)이 여성(30%)보다 많이 다뤘고, 정신건강과 외모 관리는 여성이 더 많이 다뤘다.
2. 어떻게 분석했나
보고서
본문은 10쪽 남짓이고 방법론과 부록 표가 그보다 길다. 분석
절차를 표 1에 정리했다.
표 1. 분석
절차
|
단계 |
한 일 |
도구 |
규모 |
|
대상 확정 |
1차
보고서 인플루언서 6,828명 중 계정 소멸·비공개(322명), 분석 가능한 게시물 없음(11명), 건강 게시물 없음(161명) 제외 |
1차
보고서 목록 |
6,334명 |
|
게시물 수집 |
2026.2.1~4.30
게시물을 5월에 수집. 인스타그램·틱톡은 캡션·이미지·음성·반응 지표, 유튜브는 메타데이터와 음성 |
Modash
Raw API, YouTube Data API, yt-dlp |
535,512건 |
|
음성 전사 |
말소리 구간 탐지 후 전사. 유튜브는 앞 5분까지만 |
YAMNet,
GPT-4o Transcribe Diarize |
|
|
화면 글자 |
2초에 1프레임 추출, 같은 화면 제거 후 OCR. 자막 중복·배경 글자 정리(유튜브 제외) |
EasyOCR,
GPT-4o Mini |
분석 불가
6,280건 제외 |
|
코딩북 |
질적 검토로
13개 주제, 건강 무관, 게시물 특성 3개 정의 |
|
17개
라벨 |
|
사람 코딩 |
코더 2명이
무작위 250건 코딩, 불일치는 합의로 정리. 코더 1명이 350건
추가 |
|
검증셋 600건(플랫폼별 200건) |
|
모델 분류 |
게시물마다 코딩북·지시문·텍스트를 넣고 JSON으로
라벨 출력 |
GPT-5.4
Mini(추론 medium) |
전수 |
|
추가 분석 |
질환명 추출·그룹화(상위 200개), 폐경·단백질 키워드 검색, 인플루언서 단위 집계 |
GPT-5.4
Mini, 정규식 |
|
자료: Pew
Research Center(2026.10) 방법론을 필자가 정리.
분석 대상은 표본이 아니라 목록 전체다
퓨의
건강 인플루언서 정의는 이렇다. 조직이나 브랜드가 아닌 개인이고, 세
플랫폼 중 한 곳에서 팔로워가 10만 명 이상이며, 주로
영어로 미국 수용자를 상대로 건강 정보를 꾸준히 올리는 사람이다. 1차 보고서에서 건강 키워드 검색과
계정 점검으로 이 조건에 맞는 6,828명(계정 35,325개)을 찾았다. 이번에는
그중 494명을 빼고 6,334명을 남겼다. 게시물은 인스타그램 304,562건, 틱톡 212,273건, 유튜브 18,677건이다.
이
연구에는 게시물을 뽑는 표집 단계가 없다. 정해진 목록의 석 달치 게시물을 모두 모았기 때문에 보고서의
비율에는 표본오차가 붙지 않는다. 대신 목록이 어떻게 만들어졌는지가 대표성을 정한다. 키워드 검색과 계정 점검으로 만든 목록은 확률표본이 아니어서, 미국
건강 인플루언서 전체를 얼마나 덮는지는 1차 보고서의 식별 절차를 믿고 갈 수밖에 없다. 2024년 뉴스 인플루언서 연구에서 퓨는 28,266개 계정을 검토해 500명을 층화 표집하고 게시물 104,786건을 분석했는데, 이번에는 표집 없이 목록 전체를 다뤘다.
영상을 먼저 글로 바꿨다
동영상
플랫폼의 내용분석은 텍스트를 만드는 데서 시작한다. 음성은
YAMNet 모델로 사람 말소리 구간을 찾은 뒤 GPT-4o Transcribe Diarize로
전사했다. 유튜브는 음성만 받았고 그것도 앞 5분까지만 전사했다. 인스타그램과 틱톡은 영상에서 2초에 한 장씩 프레임을 뽑아 똑같은
화면을 지우고 EasyOCR로 화면 글자를 읽었다. 화면
자막이 음성 전사와 겹치거나 배경의 무관한 글자가 섞인 경우는 GPT-4o Mini로 걸러냈다. 캡션도 화면 글자도 알아들을 수 있는 말소리도 없는 게시물과 처리 오류가 난 게시물 6,280건은 분석에서 빠졌다.
코딩북은 13개 주제와 게시물 특성 3개로 짰다
연구진은
표본 게시물을 여러 차례 질적으로 검토해 13개 주제를 정했다. 주제
라벨은 서로 배타적이지 않아서 한 게시물이 피트니스이면서 영양일 수 있다. 13개 주제 중 어디에도
해당하지 않으면 '건강 무관'으로 분류했다.
여기에
게시물 특성 세 가지를 더 쟀다. 건강 위해 경고는 특정 행위가 신체나 정신 건강에 해를 끼친다고 직접
명시한 경우로 좁게 정의했다. 질병 게시물이 증상을 설명하는 것만으로는 경고가 아니다. 외부 출처 인용은 전문가, 정부기관, 연구 결과, 의료기관 지침을 언급한 경우인데, 인용 내용이 맞는지는 확인하지 않았다. 퓨는 이 지표가 사실 여부가
아니라 설득 방식을 보여준다고 밝힌다. 홍보는 앞서 본 것처럼 넓게 정의했고, 은근한 간접 홍보나 표기 없는 협찬은 놓쳤을 수 있다고 적었다. 건강
무관 게시물은 경고와 출처 인용은 코딩하지 않고 홍보 여부만 봤다.
사람이 기준을 만들고 모델이 전수를 분류했다
검증은
두 단계로 했다. 먼저 코더 2명이 무작위로 뽑은 게시물 250건을 캡션, 음성 전사,
OCR 텍스트를 모두 읽고 코딩했다. 모든 라벨에서 일치율 88% 이상, 코헨 카파 0.6 이상이
나왔고(가중평균 일치율 95%, 카파 0.765) 엇갈린 사례는 연구진 회의에서 합의로 정했다. 카파가
가장 높은 라벨은 남성 건강(1.000)과 피트니스(0.913)였고, 가장 낮은 라벨은 정신건강(0.600), 외모 관리(0.601), 건강 습관(0.607)이었다.
이어
코더 1명이 350건을 더 코딩해 600건짜리 검증셋을 만들었다. 검증셋은 인스타그램, 틱톡, 유튜브에서 같은 수씩 뽑았다. 전수 분류는 GPT-5.4 Mini(추론 강도 medium)가 맡았다. 게시물마다 코딩북 정의와 지시문, 캡션·전사·OCR 텍스트를
넣고 JSON 형식으로 라벨을 받았다. 검증셋 기준으로 모든
라벨의 F1이 0.6 이상이었고, 가중평균은 F1 0.818, 정밀도 0.803, 재현율 0.844, 정확도 93%였다. F1이 가장 높은 라벨은 남성 건강(0.947)과 홍보(0.919)였고,
가장 낮은 라벨은 보건정책(0.600)과 질병·의료
경험담(0.633)이었다.
질병
게시물은 모델이 구체적인 질환명을 뽑게 한 뒤, 연구진이 상위 200개
질환명을 비슷한 것끼리 묶었다. 유방암과 피부암을 '암'으로 묶는 식이다. 폐경과 단백질은 정규식 키워드 검색으로 셌고, 인플루언서의 직업 배경과 성별은 1차 보고서의 분류를 그대로 썼다.
3. 방법론으로 다시 읽기
사람끼리 엇갈린 라벨에서 모델도 헤맸다
이
보고서에는 신뢰도 숫자가 두 종류 나온다. 사람 코더 간 카파는 이 범주를 사람들이 같은 뜻으로 적용할
수 있는지를 묻고, 사람 대비 모델의 F1은 모델이 사람
판단을 따라가는지를 묻는다. 내용분석의 관행과 기계학습의 관행이 한 문서에 같이 들어간 것이다.
두
숫자를 라벨별로 놓으면 함께 움직인다(그림 3). 사람끼리
카파가 낮았던 건강 습관(0.607)과 질병·의료 경험담(0.627)은 모델 F1도
0.651, 0.633으로 낮았고, 카파가 높았던 피트니스(0.913)와 남성 건강(1.000)은 F1도 0.904, 0.947로 높았다. 17개 라벨의 상관계수는 0.64다. 정신건강은 카파가 0.600으로 가장 낮은데도 F1이 0.753이어서 예외에 속한다.
그림 3
이
관계는 모델 성능이 낮은 라벨의 원인이 모델보다 범주 정의에 있을 가능성이 크다는 점을 보여준다. 건강
습관은 수면, 자외선 차단제, 생활 루틴까지 범위가 넓고
피트니스나 영양과의 경계가 모호하다. 경험담도 질병 게시물과의 구분 기준이 사람마다 다르게 적용되기
쉽다. 이런 라벨은 모델을 바꾸기보다 코딩북 정의를 다듬는 편이 성능을 올리는 데 더 효과적일 것이다.
정확도 93%는 드문 라벨에서 별 의미가 없다
방법론
표에는 정확도도 나온다. 보건정책의 정확도는 99%, 남성
건강은 99.8%다. 그러나 보건정책 게시물이 2%밖에 안 되는 상황에서는 모든 게시물을 '해당 없음'으로 찍어도 정확도가 98%가 된다.
해당 비율이 낮은 라벨일수록 정확도는 높게 나오게 되어 있어서, 보건정책 F1 0.600이 실제 성능에 더 가깝다. 퓨가 방법론 본문에서 F1을 기준으로 삼고 정확도는 표에만 넣은 것은 맞는 판단이다.
정밀도와 재현율이 다르면 비율이 한쪽으로 기운다
이
보고서에서 가장 눈여겨볼 대목은 정밀도와 재현율이 따로 공개됐다는 점이다. 정밀도는 모델이 '해당'이라고 한 게시물 가운데 사람도 '해당'이라고 한 비율이고, 재현율은
사람이 '해당'이라고 한 게시물 가운데 모델이 잡아낸 비율이다. 두 값이 같으면 모델이 '해당'으로
찍는 건수와 실제 해당 건수가 같아진다. 재현율이 정밀도보다 높으면 모델이 실제보다 많이 찍고 있다는
뜻이고, 그만큼 비율이 부풀려진다. 모델이 찍은 건수와 실제
건수의 비는 재현율÷정밀도이므로, 보고된 비율에 정밀도÷재현율을 곱하면 대략의 보정값이 나온다.
이
계산을 퓨의 라벨에 적용하면 결과가 꽤 달라진다(그림 4, 표 2). 질병·의료 경험담은 정밀도
0.526, 재현율 0.794로 차이가 가장 커서 보고값
11%가 7.3%로 내려간다. 건강 습관은 20%에서 15.8%로, 질병은 19%에서 14.7%로, 외모
관리는 14%에서 10.8%로 내려간다. 거꾸로 영양은 정밀도(0.941)가 재현율(0.799)보다 높아서 19%가
22.4%로 올라간다. 홍보는 두 값이 거의 같아서(0.916,
0.922) 38%가 그대로다.
보정하면
주제 순위가 바뀐다. 보고값으로는 피트니스 다음이 건강 습관(20%)이고
영양과 질병이 19%로 같지만, 보정값으로는 피트니스(26.7%) 다음이 영양(22.4%)이고 건강 습관(15.8%)은 그 아래다. 질병(14.7%)은
전문 치료(14.8%)와 같은 수준으로 내려온다. 생활 건강이
의료보다 많다는 보고서의 큰 결론은 그대로다. 생활 건강 쪽도 건강 습관과 외모 관리는 내려가지만 영양과
피트니스가 올라가고, 의료 쪽은 질병과 경험담이 함께 내려가기 때문이다.
그림 4

다만
이 보정에도 한계가 있다. 정밀도는 검증셋 안에서 해당 게시물이 얼마나 흔한지에 따라 달라진다. 퓨의 검증셋은 플랫폼별로 200건씩 뽑았는데 실제 게시물은 인스타그램 57%, 틱톡 40%, 유튜브
3.5%로 구성돼 있다. 유튜브가 검증셋에서는 3분의 1이고 전체에서는 3.5%다. 검증셋
구성이 전체 게시물과 다르면 검증셋의 정밀도를 전체에 그대로 쓸 수 없다.
그래서
해당 비율에 덜 흔들리는 감도(재현율과 같은 값)와 특이도로
다시 계산해 봤다. 역학에서 진단검사의 오분류를 보정할 때 쓰는
Rogan-Gladen 방식이다. 퓨는 특이도를 공개하지 않았지만, 공개된 정밀도·재현율·F1·정확도
네 값을 검증셋 600건에 맞추면 17개 라벨 중 13개에서 칸별 건수가 하나로 정해진다. 예를 들어 질병·의료 경험담은 사람이 해당으로 본 게시물 63건, 모델이 해당으로 본 게시물 95건,
둘이 겹친 게시물 50건이 되고, 여기서 특이도 0.916이 나온다. 이 방식으로 보정하면 질병·의료 경험담은 3.7%, 건강 습관은 12.8%, 질병은 11.9%까지 내려간다. 두 방식은 크기가 다르지만 방향이 같다.
표 2. 라벨별
검증 지표와 보정값
|
라벨 |
보고(%) |
카파 |
F1 |
정밀도 |
재현율 |
보정①(%) |
보정②(%) |
|
피트니스·운동 |
25 |
0.913 |
0.904 |
0.936 |
0.875 |
26.7 |
26.3 |
|
건강 습관 |
20 |
0.607 |
0.651 |
0.582 |
0.739 |
15.8 |
12.8 |
|
영양 |
19 |
0.800 |
0.864 |
0.941 |
0.799 |
22.4 |
22.3 |
|
외모 관리 |
14 |
0.601 |
0.765 |
0.679 |
0.877 |
10.8 |
10.8 |
|
일반의약품·보충제 |
11 |
0.655 |
0.762 |
0.683 |
0.862 |
8.7 |
7.6 |
|
장수 |
2 |
0.688 |
0.636 |
0.636 |
0.636 |
2.0 |
1.0 |
|
질병 |
19 |
0.817 |
0.793 |
0.704 |
0.907 |
14.7 |
11.9 |
|
전문 치료 |
14 |
0.801 |
0.807 |
0.830 |
0.785 |
14.8 |
14.6 |
|
질병·의료
경험담 |
11 |
0.627 |
0.633 |
0.526 |
0.794 |
7.3 |
3.7 |
|
여성 건강 |
8 |
0.900 |
0.818 |
0.726 |
0.938 |
6.2 |
5.4 |
|
정신건강 |
7 |
0.600 |
0.753 |
0.745 |
0.761 |
6.9 |
6.5 |
|
남성 건강 |
1 |
1.000 |
0.947 |
0.900 |
1.000 |
0.9 |
0.8 |
|
보건정책 |
2 |
0.853 |
0.600 |
0.667 |
0.545 |
2.4 |
2.8 |
|
건강 무관 |
30 |
0.855 |
0.854 |
0.886 |
0.825 |
32.2 |
33.2 |
|
홍보 |
38 |
0.832 |
0.919 |
0.916 |
0.922 |
37.8 |
34.4 |
|
건강 위해 경고 |
11 |
0.741 |
0.676 |
0.653 |
0.700 |
10.3 |
9.4 |
|
외부 출처 인용 |
9 |
0.834 |
0.808 |
0.728 |
0.908 |
7.2 |
5.6 |
주: 카파는
무작위 250건, F1·정밀도·재현율은 검증셋 600건 기준(퓨
방법론 표). 보정①은 보고값×정밀도÷재현율, 보정②는 Rogan-Gladen 방식으로 필자 계산. 보정②의 특이도는 검증셋 칸별 건수를 역산해 구했으며, 피트니스·건강 습관·남성
건강·홍보는 맞는 조합이 둘 이상이라 그중 하나를 썼다.
역산한
숫자는 검증셋이 전체 게시물과 다르다는 단서도 준다. 검증셋에서 사람이 홍보로 코딩한 게시물은 53% 안팎인데 전체 게시물의 홍보 비율은 38%다. 질병·의료 경험담도 검증셋에서 모델이 해당으로 찍은 비율이 15.8%로 전체 보고값 11%보다 높다. 같은 모델이 분류했으니 차이는 검증셋 구성에서 온다.
해법은
조사방법론에 이미 있다. 검증셋은 플랫폼별 층화표본이고 층별 배분과 모집단 구성을 모두 알고 있으므로, 플랫폼 비중으로 가중하면 모집단 기준의 정밀도·재현율을 얻을 수
있다. 계산사회과학에서도 사람이 코딩한 무작위 표본과 모델 예측을 결합해 편향 없는 추정값과 신뢰구간을
내는 방법들이 나와 있다. 설계 기반 지도학습(DSL, Egami 외 2023)과 예측 기반 추론(PPI, Angelopoulos 외 2023)이 대표적이다. 퓨는 지표를 공개하는 데까지 갔고, 그 지표로 추정값을 고치는 일은 독자에게 남겨뒀다.
600건 검증셋은 드문 라벨을 재기에 작다
역산
결과를 보면 검증셋에서 사람이 보건정책으로 코딩한 게시물은 11건, 남성
건강은 9건, 장수는 22건
정도다. 보건정책의 재현율 0.545는 11건 중 6건을 맞힌 결과이고, 이
비율의 95% 신뢰구간은 0.28에서 0.79까지 벌어진다. 그림 3에서
보건정책만 카파가 높은데도 F1이 낮게 떨어진 것은 사례가 적어서 생긴 우연한 변동일 수 있다.
드문
라벨을 제대로 재려면 검증셋을 뽑을 때 모델이 해당으로 찍은 게시물을 과대 표집하고 나중에 가중하면 된다. 소수
집단을 과대 표집하는 조사 설계와 같은 원리다.
게시물 비율은 올라온 양이고 본 양은 아니다
보고서의
비율은 게시물 하나를 1로 센다. 많이 올리는 계정이 결과를
크게 좌우하고, 플랫폼으로 보면 인스타그램과 틱톡이 게시물의
96.5%를 차지한다. 조회수나 팔로워 수로 가중하지 않았으니 이 숫자는 공급 쪽의 구성이다. 보고서는 미국인이 인플루언서에게서 무엇을 듣게 되는지를 알아보려 했다고 소개하는데, 듣게 되는 양을 재려면 노출로 가중한 수치가 필요하다. 방법론에
따르면 인스타그램과 틱톡은 Modash API로 반응 지표까지 받았으므로 조회 가중 분석이 가능했을
것이다.
인플루언서
단위의 '한 번이라도 올린 비율'은 게시량이 많을수록 높아진다. 석 달 동안 300건을 올린 계정과 30건을 올린 계정은 어떤 주제를 한 번이라도 건드릴 확률이 다르다. 성별
비교에서 남녀의 게시량 차이를 통제했는지는 나와 있지 않다. 주력 주제를 정하는 30% 기준도 게시물이 적은 계정에서는 4건 대 3건의 차이로 주력 여부가 정해진다.
내용분석에도 총조사오차가 있다
설문조사의
총조사오차(TSE)를 이 연구에 겹쳐 보면, 퓨가 숫자로
보고한 오차는 분류 단계 하나뿐이다. 목록 구축 단계에는 키워드 검색이 놓친 인플루언서와 기간 중 사라진
계정 322명이 있다(포괄오차). 텍스트화 단계에서는 말소리도 글자도 없는 게시물 6,280건이
빠졌고, 유튜브는 5분 이후 내용이 측정되지 않았다. 음악만 깔린 운동 영상이 많이 빠졌다면 피트니스는 과소 측정됐을 수 있다. 전사와 OCR 오류는 분류 오류와 겹쳐 쌓이는데, 검증셋 코더도 영상이 아니라
같은 전사·OCR 텍스트를 읽었기 때문에 이 단계의 오류는 F1에
잡히지 않는다. 질환명 그룹화처럼 연구진의 판단이 들어가는 처리 단계도 있다.
4. 조사 현장에 가져올 것
이
보고서의 절차는 설문조사의 주관식 응답 코딩에 그대로 옮길 수 있다. 코딩북을 만들고, 사람 둘이 무작위 응답을 코딩해 카파를 내고, 모델이 전수를 분류하고, 검증셋으로 코드별 정밀도·재현율을 낸 뒤 차이가 크면 비율을 보정하는
순서다. 지금 국내 조사 보고서의 주관식 결과는 사람이 코딩했든 모델이 코딩했든 신뢰도 지표 없이 분류
결과만 싣는 경우가 대부분이다.
설계에서도
배울 점이 있다. 퓨는 1차에서 수용자가 무엇을 듣는다고
답하는지를 설문으로 묻고, 2차에서 같은 인플루언서 목록의 게시물을 실측했다. 1차 설문에서 수용자 셋 중 하나 이상이 피트니스·체중 감량·외모 이야기를 자주 듣는다고 답했고, 2차에서 피트니스는 실제로 게시물
주제 1위였다. 응답자의 기억과 보고에 기대는 설문의 한계를
콘텐츠 실측으로 보완한 설계다. 국내에서도 정치 유튜브 이용 조사나 건강 정보 이용 조사에 같은 방식의
실측을 붙여볼 수 있다.
LLM 내용분석 결과를
낼 때 갖춰야 할 보고 항목을 퓨 사례를 바탕으로 정리하면 다음과 같다.
1. 코딩북 정의와 모델 지시문, 출력
스키마를 공개한다.
2. 사람 코더 간 일치도를 라벨별로 낸다.
3. 검증셋을 어떻게 뽑았는지 밝히고, 모집단과
구성이 다르면 가중한다.
4. 라벨별 정밀도와 재현율을 따로 내고,
둘의 차이가 크면 보정값을 함께 보인다.
5. 드문 라벨은 검증셋에서 과대 표집하고 성능 지표에 신뢰구간을 붙인다.
6. 텍스트화 단계에서 빠진 사례 수와 측정되지 않은 부분(영상 길이 제한 등)을 밝힌다.
퓨는 이 가운데 1, 2, 6번을 했고 3, 4번은 절반쯤 했다. 국내 조사회사의 주관식 코딩 보고와 비교하면 그것만으로도 한참 앞서 있다.
맺으며
모델에게 53만 건을 코딩시키는 비용은 이제 크지 않다. 비용이 줄어든 만큼
내용분석의 품질은 사람이 맡는 두 가지 일, 범주를 정의하는 일과 모델이 얼마나 틀리는지 재는 일에서
정해진다. 퓨 보고서에서 모델 성능이 낮았던 라벨이 사람끼리도 엇갈린 라벨이었다는 점, 공개된 정밀도·재현율만으로 주제 순위가 바뀐다는 점이 그 근거다. LLM으로 만든 숫자를 읽을 때는 본문 수치와 함께 방법론의 검증 표를 같이 보는 습관이 필요하다.
참고 자료
Pew Research Center (2026.10.7). What Do Health and Wellness
Influencers Post About?
https://www.pewresearch.org/data-labs/2026/10/07/what-do-health-and-wellness-influencers-post-about/
Pew Research Center (2026.5.7). Moms, Coaches, Doctors,
Entrepreneurs: Who Are America's Health and Wellness Influencers?
https://www.pewresearch.org/data-labs/2026/05/07/moms-coaches-doctors-entrepreneurs-who-are-americas-health-and-wellness-influencers/
Pew Research Center (2026.5.7). The topics Americans learn about
from health and wellness influencers.
https://www.pewresearch.org/data-labs/2026/05/07/the-topics-americans-learn-about-from-health-and-wellness-influencers/
Pew Research Center (2024.11.18). America's News Influencers.
https://www.pewresearch.org/journalism/2024/11/18/americas-news-influencers/
Egami, N., Hinck, M., Stewart, B. M., & Wei, H. (2023).
Using Imperfect Surrogates for Downstream Inference: Design-based Supervised
Learning for Social Science Applications of Large Language Models. NeurIPS
2023.
Angelopoulos, A. N., Bates, S., Fannjiang, C., Jordan, M. I.,
& Zrnic, T. (2023). Prediction-powered inference. Science, 382(6671),
669–674.
Rogan, W. J., & Gladen, B. (1978). Estimating prevalence
from the results of a screening test. American Journal of Epidemiology, 107(1),
71–76.