← 검색으로

한국어 웹은 얼마나 작은가

검색엔진을 만들려고 웹을 훑다가 알게 된 것: 한국어는 생각보다 훨씬 적다. Common Crawl 에서 5,354,171개 레코드를 훑어 한국어 문서 44,888건을 얻었습니다. 수율 0.84% — 120건을 훑어야 한국어 1건이 나옵니다.

측정값

분모를 함께 적었습니다. 분모 없는 비율은 검증할 수 없기 때문입니다.
지표분모
훑은 Common Crawl 레코드5,354,171
그중 한국어 문서44,8885,354,171
한국어 수율0.84 %5,354,171
한국어 1건당 내려받은 바이트372,578 B44,888
보유 코퍼스 문서70,816
색인된 문서 ( 기준)54,793
색인의 고유 호스트 ( 기준)4,37554,793

이 숫자가 뜻하는 것

한국어 문서 하나를 얻는 데 평균 373 kB를 내려받아야 합니다(1 kB = 1,000 B). 100만 건을 모으려면 대략 373 GB를 훑어야 한다는 뜻입니다. 한국어 검색엔진을 새로 만들기 어려운 이유가 알고리즘이 아니라 이 수율에 있다는 것이 우리가 얻은 결론입니다.

어떻게 쟀나

한계를 먼저 적습니다.

이 수치는 Common Crawl 이 훑은 웹의 성질이지 웹 전체의 성질이 아닙니다. Common Crawl 이 덜 훑는 영역(로그인 뒤, 앱 안, 크롤을 막은 사이트)에 한국어가 몰려 있다면 실제 비율은 이보다 높습니다. 우리는 그것을 재지 못했고, 재지 못했다고 적습니다.

원자료

가공 없이 그대로 씁니다. 출처만 밝혀 주세요(CC BY 4.0).

JSON 내려받기 CSV 내려받기

왜 이걸 공개하나

XKATOR 는 한국어 웹을 직접 색인합니다. 그 과정에서 나온 숫자를 우리만 갖고 있을 이유가 없습니다. 같은 걸 만들려는 사람에게는 비용 추정치가 되고, 쓰는 사람에게는 우리가 무엇을 근거로 말하는지를 보여주는 자료가 됩니다.

XKATOR 가 무엇을 저장하고 무엇을 저장하지 않는지