단어 빈도 분석 analyze
텍스트에서 각 단어나 문자가 몇 번 등장하는지 세어 많이 나온 순으로 정렬합니다.
이 도구가 하는 일
텍스트에서 어떤 단어가 자주 등장하는지 세어 보면 그 문서의 성격이 드러납니다. 원고에서 같은 표현을 반복하고 있지는 않은지, 로그에서 어떤 오류 메시지가 가장 많이 찍히는지, 문서가 어떤 주제어를 중심으로 쓰였는지를 빠르게 확인할 수 있습니다.
이 도구는 입력한 텍스트를 단어 또는 문자 단위로 쪼갠 뒤 등장 횟수를 세어 정렬합니다. 단어 인식은 유니코드 기준으로 문자와 숫자가 이어진 덩어리를 하나의 단어로 봅니다. 영문뿐 아니라 한글도 그대로 집계되며 문장부호는 자동으로 제외됩니다.
최소 길이를 지정하면 짧은 조사나 관사를 걸러낼 수 있고, 상위 몇 개까지 볼지도 정할 수 있습니다. 각 항목에는 막대와 비율이 함께 표시되어 분포를 눈으로 파악할 수 있으며, 결과 전체를 탭으로 구분된 형식으로 복사해 스프레드시트에 붙여 넣을 수 있습니다.
언제 사용하나요
글을 쓰고 나서 같은 단어를 과하게 반복했는지 점검할 때, 로그에서 가장 자주 나타나는 오류 문구를 찾을 때, 문서의 핵심 주제어를 뽑을 때, 설문 응답이나 리뷰에서 자주 언급된 표현을 확인할 때 사용합니다.
입력과 출력 예시
the quick brown fox jumps over the lazy dog the end
the 3 / quick 1 / brown 1 ...
가장 많이 등장한 순으로 정렬되고 비율이 함께 표시됩니다.
최소 길이 3으로 설정
세 글자 미만 단어가 집계에서 제외됨
조사나 짧은 기능어를 걸러낼 때 사용합니다.
주의사항
단순 빈도 집계이므로 형태소 분석은 하지 않습니다. 한국어에서 같은 단어라도 조사가 붙으면 다른 항목으로 집계되고, 영어에서도 단수와 복수, 동사 변화형이 각각 따로 세어집니다. 정확한 어휘 분석이 필요하다면 형태소 분석기를 사용해야 합니다. 또한 the, a, 그리고, 하지만 같은 기능어가 상위를 차지하는 것이 보통이므로, 의미 있는 단어를 보려면 최소 길이 옵션을 올려 걸러내는 것이 좋습니다. 아주 긴 텍스트에서는 브라우저가 잠시 느려질 수 있습니다.
자주 묻는 질문
한국어 조사도 따로 세어지나요?
그렇습니다. 형태소 분석을 하지 않으므로 도구를과 도구는이 다른 항목으로 집계됩니다. 어간 기준 분석이 필요하면 형태소 분석기를 사용하십시오.
결과를 엑셀로 옮길 수 있나요?
가능합니다. 복사 버튼을 누르면 탭으로 구분된 형식으로 복사되어 스프레드시트에 바로 붙여 넣을 수 있습니다.