뜻밖일수록 크다 — 문제지 한 장과 지도 한 장의 비트
V2 공개자료 교차확인 — 둘 이상의 독립된 자료로 확인
탐구 주제
IYPT 1989 문제 16 ‘Information’에 관한 원리 해설과 탐구 설계입니다.
교육과정 연결
고등학교 「정보」 「데이터」(디지털 데이터의 표현과 압축) / 통합과학2 「환경과 에너지」(에너지 전환과 효율 — 정보를 지우는 데 드는 최소 에너지) / 진로선택 「역학과 에너지」(열역학 제2법칙과 엔트로피) / 수학 「확률과 통계」(확률분포와 기댓값) · 과학탐구실험1(측정과 자료 분석) (2022 개정 교육과정, 단원 코드는 NCIC에서 최종 확인).
핵심 개념
정보량, 비트, 섀넌 엔트로피, 자기정보량(놀라움), 1차 엔트로피, 조건부 엔트로피, 문맥, 중복성(redundancy), 무손실 압축, 압축률, 부호화, 사전 지식, 표본화와 해상도, 계조, 화소당 비트, 정보 전달률, 란다우어 원리
원리 살펴보기
“오늘 해가 동쪽에서 떴다”와 “오늘 눈이 왔다” 중 어느 쪽이 더 많은 것을 알려 주는가? 정보의 크기는 내용의 무게가 아니라 뜻밖인 정도로 정해진다. 일어날 확률이 p인 일이 실제로 일어났을 때 받는 정보량을 −log₂p 비트로 잡으면, 반반인 일은 1 bit, 확률이 절반으로 줄어들 때마다 1 bit씩 늘어난다. 여러 결과가 확률 p₁, p₂, …로 갈리는 소식통이 한 번에 내보내는 정보량의 평균이 섀넌 엔트로피 H = −Σ p log₂p이고, 이것이 그 소식을 흠 없이 적어 두는 데 필요한 최소 비트 수다. 그래서 “몇 비트인가”라는 물음은 “가장 알뜰하게 적으면 몇 자리인가”라는 물음과 같은 물음이다.
글은 이 잣대로 재기 좋은 대상이다. 알파벳 26자가 모두 똑같이 나온다고 보면 한 글자는 log₂26 = 4.7 bit를 나른다 — 섀넌이 1951년 논문에서 공백과 문장 부호를 뺀 26자 알파벳을 두고 잡은 출발점 F₀가 이 값이다. 그런데 e는 흔하고 z는 드물다. 글자 빈도만 넣어도 F₁ = 4.14 bit로 내려가고, 앞 글자와의 짝을 보면 F₂ = 3.56 bit, 단어 통계까지 쓰면 2.62 bit가 된다. 사람에게 다음 글자를 맞히게 한 실험에서는 앞의 100자를 알고 있을 때 상한 1.3 bit·하한 0.6 bit — 문맥을 아는 만큼 글자당 정보량은 계속 줄어든다. 줄어든 몫이 중복성이며, 섀넌은 그 값을 약 75 %로 보았다. 뒤집어 말하면 무손실 압축으로 파일이 잘 줄어드는 글일수록 원래 담긴 정보는 적다 — 긴 글에서 압축 뒤의 크기는 엔트로피의 상한 어림이 된다. 인쇄 한국어를 확률 모형으로 잰 상한은 음절당 6.01 bit로 보고되어 있다.
이 셈법은 오늘날 기술의 바닥에 깔려 있다. 파일 압축과 저장·전송(중복을 걷어 낸 나머지가 곧 정보이므로, 압축률은 그 파일이 얼마나 알찬지를 재는 자가 된다), 통신 채널과 오류 정정 부호(잡음이 있는 길로 보낼 수 있는 최대 속도가 채널 용량으로 정해지고, 심우주 탐사선과 QR 코드는 일부러 비트를 더 붙여 오류를 되살린다), 암호와 무작위성(열쇠의 안전성은 길이가 아니라 예측 불가능성의 비트 수로 매긴다 — 규칙적인 비밀번호는 길어도 엔트로피가 낮다), 기계학습과 언어 모형(다음 글자를 얼마나 잘 맞히는지를 나타내는 지표가 곧 글자당 비트여서, 잘 예측하는 모형은 그대로 좋은 압축기가 된다)에 두루 쓰인다.
실험 설계
준비물
컴퓨터(파이썬 또는 표 계산 프로그램), 텍스트 편집기, 압축 프로그램(zip 또는 gzip), 저작권이 풀린 공개 텍스트 파일(한국어·영어 각 1개, 같은 내용의 두 언어판이면 더 좋다), 공공기관이 공개한 지도 한 장 또는 그 이미지 파일, 스캐너나 스마트폰 카메라, 해상도를 바꿀 수 있는 이미지 편집 프로그램, 자, 모눈종이.
변인
독립변인은 ‘세는 방법의 문맥 길이’이다(균등 가정 → 글자 빈도 → 압축 → 사람의 문맥 추측 순으로 한 단계씩만 바꾼다). 지도 쪽의 독립변인은 스캔 해상도(dpi)이다. 종속변인은 기호당 비트 수(총 비트 ÷ 기호 수)와, 지도에서 판독되는 지명의 비율이다. 통제변인은 텍스트의 분량·갈래·문자 부호(UTF-8), 압축 프로그램과 압축 수준, 지도의 원본과 계조, 판독 여부를 가르는 기준과 화면 확대 배율, 관찰 거리이다.
실험 순서
-
공개 텍스트 파일에서 기호 수 N을 세고, 쓰인 기호 종류가 k가지일 때 균등 가정 상한 N·log₂k를 계산한다 — 이것이 가장 헐거운 어림이다(영문 26자면 글자당 4.7 bit).
-
기호별 출현 빈도로 확률 p를 구해 1차 엔트로피 H₁ = −Σ p log₂p를 계산하고, N·H₁을 ①과 견준다. 줄어든 몫이 빈도의 치우침에서 온 중복성이다.
-
같은 파일을 압축해 (압축 파일 바이트 수 × 8) ÷ N으로 기호당 비트를 구한다. 압축은 되돌릴 수 있으므로 이 값도 상한 쪽 어림이다(평균 부호 길이는 엔트로피보다 짧아질 수 없다). 파일이 짧으면 압축기가 통계를 익히지 못해 이 값이 1차 엔트로피보다 높게 나온다 — 글을 이어 붙여 늘려 가며 어디로 수렴하는지 본다. 한글은 한 음절이 3바이트라 음절 수로 세어야 하고, 5만 음절쯤 모아야 1차 엔트로피 아래로 내려온다.
-
섀넌의 추측 실험을 학급에서 재현한다. 한 문장을 가린 뒤 앞부분만 보여 주고 다음 한 글자를 맞힐 때까지의 시도 횟수를 사람마다 기록한다. 100자 남짓 모아 시도 횟수의 분포를 그리면, 문맥이 정보량을 얼마나 깎는지 어림할 수 있다.
-
지도를 600·300·150·75 dpi로 각각 저장해 파일의 비트 수를 적고, 같은 지명 목록을 몇 개까지 읽을 수 있는지 세어 판독 문턱을 찾는다(사람 눈은 25 cm에서 약 0.07 mm를 가르므로 300 dpi가 대략 눈의 한계에 해당한다).
-
같은 지도에서 지명·기호의 개수 N_f를 직접 세고, 위치를 1 mm 격자로 지정하는 데 드는 log₂(격자 칸 수)와 이름을 크기 M인 지명 목록에서 고르는 데 드는 log₂M을 더해 N_f·(log₂칸수 + log₂M)로 ‘의미의 비트’를 어림한 뒤 ⑤의 값과 나란히 적는다.
안전 안내
⚠ 안전남의 개인정보가 담긴 파일(주소록, 메신저 대화, 사진, 성적 자료)이나 저작권이 살아 있는 책·지도를 실험 재료로 쓰지 않는다 — 저작권이 풀렸거나 공공기관이 이용을 허락한 자료만 쓴다. 압축·복원은 반드시 사본으로 하고 원본은 따로 남긴다. 출처가 불확실한 파일을 내려받아 풀지 않는다. 화면을 오래 보는 작업이므로 20분마다 20초씩 먼 곳을 바라보고, 1시간마다 일어나 목과 어깨를 편다. 화면 밝기를 주변 조명에 맞추고, 눈높이와 팔꿈치 각도를 맞춘 자세로 앉는다. 스캐너를 쓸 때는 덮개를 닫아 강한 빛을 직접 보지 않는다.
예상과 해석
먼저 예상해 보기
지도 한 장을 화소 수로 센 비트와 그 위에 실린 지명·위치로 센 비트는 몇 자릿수나 벌어질까? 그리고 해상도를 낮춰 갈 때 ‘읽을 수 있음’은 어느 지점에서 무너질까?
자료 정리
텍스트는 가로축에 세는 방법(균등 가정·글자 빈도·압축·문맥 추측)을, 세로축에 기호당 비트를 놓아 계단 그래프로 그리고 한국어와 영어를 두 계열로 겹친다. 압축값은 파일 크기를 가로축(로그 눈금)으로 한 그래프를 따로 그려 수렴하는지 확인한다. 지도는 가로축을 해상도(dpi, 로그), 세로축을 파일 비트 수(로그)로 잡고 판독된 지명의 비율을 같은 그림에 겹쳐 문턱을 표시한다. 마지막에 문제지 한 장과 지도 한 장의 총 비트를 화소 기준·의미 기준으로 나눠 로그 눈금 막대 하나에 나란히 세운다. (수치는 실제 측정으로 채운다 — 여기서는 축과 개형만 제시한다.)
결과의 의미
기호당 비트는 세는 방법이 정교해질수록 단조롭게 낮아질 것으로 예상된다. 균등 가정에서 빈도로, 다시 압축과 문맥 추측으로 갈수록 값이 내려가고, 처음과 끝의 차이가 그 글의 중복성이다. 다만 압축값은 파일이 짧으면 1차 엔트로피와 별로 다르지 않다가 파일이 길어져야 비로소 낮아진다 — 압축기가 통계를 배울 시간이 필요하기 때문이며, 그래도 사람이 문맥으로 도달하는 값까지 내려가지는 않을 것으로 보인다. 지도 쪽은 대비가 훨씬 극적이다. A4 크기를 300 dpi 컬러로 뜨면 화소만 870만 개, 비트로는 억 단위가 되지만, 지물 수백 개를 위치와 이름으로 적는 데 드는 비트는 만 단위에 그친다. 같은 종이 한 장이 어떤 자로 재느냐에 따라 네 자릿수 안팎으로 달라지는 셈이며, 문제지 한 장의 글자가 나르는 비트는 지도의 화소가 아니라 지도의 의미 쪽과 같은 자릿수에 놓인다. 그리고 결정적인 것이 남는다 — 이미 아는 지역의 지도를 다시 볼 때 받는 정보는 0에 가깝다. 정보량은 종이가 아니라 종이와 읽는 사람 사이에서 정해진다.
더 탐구하기
-
같은 내용의 한국어·영어 병렬 문서로 ①~③을 되풀이해, 글자당 비트는 달라도 같은 내용을 나르는 총 비트는 어떤지 견주어 보자 — 여러 언어의 말하기 정보 전달률이 비슷했다는 보고와 비교해 보자.
-
지도 이미지의 손실 압축 품질을 단계별로 낮추며 파일 비트와 판독되는 지명 수를 함께 재어, ‘버려도 되는 비트’와 ‘버리면 안 되는 비트’의 경계가 어디인지 그려 보자.
-
지도를 1분 동안 본 뒤 기억나는 지명과 위치를 적게 해 초당 비트로 환산하고, 사람의 행동으로 나오는 정보 처리량이 초당 10 bit 규모라는 보고와 견주어 보자 — 눈이 받아들이는 양과 실제로 남는 양의 차이를 재는 실험이다.
-
1 bit를 지우는 데 최소 kT ln2(300 K에서 약 3×10⁻²¹ J)의 열이 나온다는 란다우어 원리로, 앞서 잰 지도 파일을 지울 때의 최소 발열을 계산해 보자.
연결 주제
IYPT 2016 문제 1 ‘기계식 난수 발생기’ — 난수의 품질을 예측 불가능성의 비트로 매기는 문제여서, 이 원고의 엔트로피 계산을 그대로 검정 도구로 쓸 수 있다. IYPT 1992 문제 11 ‘홉필드 모형’과도 이어진다(뉴런 N개에 저장할 수 있는 패턴 수의 한계 — 기억 용량을 비트로 재는 같은 물음).
참고문헌
[학생] 위키백과 ‘정보 엔트로피’·‘데이터 압축’ / 검색어 “Shannon game”, “섀넌 엔트로피 계산” / 뉴질랜드 Computer Science Field Guide의 섀넌 추측 실험 온라인 도구 / [심화] C. E. Shannon, “Prediction and Entropy of Printed English,” Bell System Technical Journal 30(1), 50–64, 1951, DOI 10.1002/j.1538-7305.1951.tb01366.x (공백을 뺀 26자 알파벳 기준 F₀=4.7·F₁=4.14·F₂=3.56 bit / 공백을 한 기호로 넣은 27기호 기준으로, 앞 100자를 알 때 상한 1.3·하한 0.6 bit, 중복성 약 75 %) · T. M. Cover, R. C. King, “A convergent gambling estimate of the entropy of English,” IEEE Transactions on Information Theory 24(4), 413–421, 1978, DOI 10.1109/TIT.1978.1055912 (베팅형 추측 실험, 공백을 넣은 27기호로 약 1.3 bit/기호) · Y. Han 외, “An upper bound estimate for the entropy of Korean texts,” Literary and Linguistic Computing 11(3), 141–146, 1996, DOI 10.1093/llc/11.3.141 (인쇄 한국어 음절당 6.01 bit 상한) · C. Coupé 외, “Different languages, similar encoding efficiency,” Science Advances 5(9), 2019, DOI 10.1126/sciadv.aaw2594 · J. Zheng, M. Meister, “The unbearable slowness of being,” Neuron 113(2), 192–204, 2025, DOI 10.1016/j.neuron.2024.11.008 · A. Bérut 외, “Experimental verification of Landauer’s principle,” Nature 483, 187–189, 2012, DOI 10.1038/nature10872. ※ 한국어의 문맥 엔트로피를 사람 추측 실험으로 직접 잰 공개 자료, 그리고 같은 지도를 화소와 의미 두 자로 재어 격차를 실측한 학교 수준 절차는 찾기 어렵다 — 그 두 값을 재는 것이 이 탐구의 개방 지점이다.