<aside> 📰
기사 링크 (경향신문)
</aside>
<aside> 📌
분석의 배경
</aside>
<aside> 💻
데이터 수집 개요
</aside>
모델링에 활용한 데이터의 수집 기간은 22대 국회 개원일인 2024년 5월 30일부터 2026년 7월 초까지입니다.
| 데이터 소스 | 데이터 유형 | 문서 단위 | 채점 문서 수 | 비고 |
|---|---|---|---|---|
| 의회 정보 | 법안 발의 | 대표발의 법안 1건 (제안이유와 주요내용) | 18,995건 | 공동발의는 제외, 대표발의자에게만 귀속 |
| 의회 정보 | 회의록 발언 | 의원 × 회의 (회의당 발언 7개를 길이 층화 무작위 표집) | 약 23,000행 | 상임위와 본회의 속기록 |
| 의회 정보 | 기자회견 | 국회 소통관 회견문 1건 | 약 6,200건 | 대표 발언자에게 귀속 |
| 언론 보도 | 기사 | 기사 × 의원 (해당 의원이 기사의 주체인 경우만) | 약 166,000건 | 중복 기사 제거 후 의원당 72시간 30건 상한, 역확률 가중으로 보정 |
위 표에서도 확인할 수 있듯, 데이터 소스는 크게 두 가지입니다.
최종적으로 16만여건의 기사들을 활용한 언론 보도 분석의 경우, 각 정치인들을 언급한 국내 기사들을 단순 집계할 경우 약 105만건으로, 그 수가 너무 많기에 시간·비용 효율화를 위해 다음과 같은 방식으로 뉴스 데이터 전처리를 진행했습니다.
국내 주요 포털에 서비스 중인 211개 언론사를 선정
강원도민일보, 강원일보, 경기신문, 경기일보, 경남도민일보, 경남신문, 경남일보, 경북도민일보, 경북매일신문, 경북일보, 경상일보, 경인일보, 경향신문, 광남일보, 광주MBC, 광주매일신문, 광주일보, 국민일보, 국제신문, 글로벌에픽, 금강일보, 기자협회보, 기호일보, 남도일보, 내일신문, 노컷뉴스, 녹색경제신문, 농민신문, 뉴데일리, 뉴스1, 뉴스로드, 뉴스웍스, 뉴스클레임, 뉴스타파, 뉴스토마토, 뉴스투데이, 뉴스펭귄, 뉴스프리존, 뉴스핌, 뉴시스, 당진시대, 대구MBC, 대구신문, 대구일보, 대전MBC, 대전일보, 대한경제, 대한전문건설신문, 더스쿠프, 더팩트, 더퍼블릭, 데일리안, 데일리한국, 동아사이언스, 동아일보, 동양일보, 디지털데일리, 디지털타임스, 디지틀조선TV, 딜사이트, 마이데일리, 매경이코노미, 매일경제, 매일경제TV, 매일신문, 매일일보, 머니S, 머니투데이, 메트로경제, 목포MBC, 무등일보, 문화일보, 미디어오늘, 미디어펜, 베이비뉴스, 부산일보, 브레이크뉴스, 브릿지경제, 블로터, 비즈니스포스트, 비즈워치, 새전북신문, 서울경제, 서울경제TV, 서울신문, 서울파이낸스, 설악신문, 세계비즈, 세계일보, 소비자가 만드는 신문, 스마트투데이, 스트레이트뉴스, 스포츠서울, 스포츠월드, 스포츠한국, 시사IN, 시사오늘, 시사위크, 시사저널, 시사저널이코노미, 신동아, 신아일보, 아시아경제, 아시아에이, 아시아타임즈, 아시아투데이, 아이뉴스24, 아주경제, 여성신문, 여수MBC, 연합뉴스, 연합뉴스TV, 연합인포맥스, 영남일보, 영주시민신문, 오마이뉴스, 울산MBC, 울산매일, 울산신문, 월요신문, 위키리크스한국, 이뉴스투데이, 이데일리, 이지경제, 이코노미스트, 이코노미톡뉴스, 이코노믹리뷰, 이투데이, 인사이트, 인천일보, 일요서울, 일요신문, 잡포스트, 전남일보, 전라일보, 전북도민일보, 전북일보, 전자신문, 전주MBC, 제민일보, 제주MBC, 제주일보, 조선비즈, 조선일보, 조세일보, 주간경향, 주간동아, 주간조선, 주간한국, 중도일보, 중부매일, 중부일보, 중앙SUNDAY, 중앙일보, 지디넷코리아, 직썰, 채널A, 춘천MBC, 충북일보, 충청일보, 충청타임즈, 충청투데이, 코리아중앙데일리, 코리아헤럴드, 쿠키뉴스, 파이낸셜뉴스, 파이낸셜리뷰, 파이낸셜투데이, 파이낸셜포스트, 팝콘뉴스, 평택시민신문, 포인트데일리, 포항MBC, 폴리뉴스, 프레시안, 한겨레, 한겨레21, 한경비즈니스, 한국경제, 한국경제TV, 한국일보, 한라일보, 허프포스트코리아, 헤럴드경제, 헬로디디, 헬스조선, 홍성신문, 환경일보, bnt뉴스, CJB청주방송, CNB뉴스, EBN, EBS, JIBS, JTBC, kbc광주방송, KBS, KPI뉴스, MBC, MBC강원영동, MBC경남, MBC충북, MBN, M이코노미뉴스, OBS, PD-저널, SBS, SBS Biz, TV조선, YTN, YTN라디오
이 언론사의 전체 기사들 중 ‘정치’ 섹션에 게재된 기사들만을 선택. 또한 정치 섹션임에도 [포토], [속보], [영상]과 같은 태그의 제목으로 시작하거나 본문 길이가 100자 미만일 경우에도 마찬가지로 제외
개체명인식 알고리즘 (NER, Named Entity Recognition)을 활용해, 22대 국회의원 319명의 이름을 단순 텍스트로서가 아니라 유의미하게 인물명을 포착한 기사들만을 추출 (ex. 일반명사로서 “이주 이후에도 조국에 대한 생각을 잊지 않은..”과 같은 문장은 패스. “조국 원장은 이날 페이스북에 올린…”은 유효 / “선박정보를 상시간 모니터링하며…”는 패스. “행사를 주최한 박정 의원은”은 유효.)
제목과 본문이 완전히 중복된 기사들 (ex. 통신사 기사 단순 전재, 보도자료 일괄 작성 등)은 1건만 제외하고 삭제
그럼에도 여전히 많은 기사들이 존재하기에, 최종적으로 동일한 ‘사안(issue)’ 단위 중복 기사들을 필터링하는 작업이 필요 (ex. 인요한 의원 국회의원직 사퇴 기자회견을 연합뉴스에서 1보, 2보, 종합으로 반복 작성하고 이들을 다시 수십여개 언론사가 거의 동일한 내용으로 중복 작성). 이 문제를 해결하기 위해 군집화(clustering) 알고리즘을 적용.
물론 위의 방식은 “언론이 애초에 어떠한 정치인을 얼만큼 보도하고 있느냐”의 문제에 의존적일 수밖에 없습니다. 따라서 이는 어디까지나 기사를 통해 파악되는 정치인의 정보라는 한계를 염두에 둘 필요가 있습니다.
본회의 표결 1,627건은 모델에 투입하지 않고 별도로 집계했습니다. (표결의 역할은 후술)
<aside> 🧭
표결 대신 LLM(AI)이 법안 내용을 직접 읽고 평가(채점)하는 방식을 택한 이유
</aside>
<aside> 🤖
AI의 채점(평가) 기준
</aside>