Command Palette

Search for a command to run...

단어 빈도 카운터: 가장 많이 사용되는 단어를 찾는 방법 (그리고 왜 중요한지)

단어 빈도 카운터: 가장 많이 사용되는 단어를 찾는 방법 (그리고 왜 중요한지)

T
Toolz Team
|Aug 23, 2026|15 최소 읽기

텍스트 도구 모음의 일부

처음으로 단어 빈도 카운터를 통해 내 자신의 블로그 게시물 중 하나를 실행했을 때,나는 약간 노출 된 느낌이 들었다. 나는 1,200 단어 기사에서 "basically"라는 단어를 14 번 사용했습니다. "occasionally" 14 번. 14 번. 내 눈은 글을 쓰는 동안 그들 모두를 바로 얼버무 렸습니다. 왜냐하면 그것이 바로 목발 단어가하는 일이기 때문입니다: 그들은 평범한 시야에 숨깁니다. 빈도 수는 당신의 의도에 관심이 없습니다. 그것은 단지 계산되며,그 숫자는 당신이 그것을 논쟁하기 위해 대담하게 화면에 앉아 있습니다.

나는 [Toolz.dev](/에서 도구를 구축하고, 나는 쓰기 내 주 대부분을 보내고: 워드 프레스 플러그인에 대한 문서, 마케팅 복사, 라라벨 자습서, 릴리스 노트. 단어 빈도 분석은 조용히 내가 어떤 선박 전에 실행하는 검사 중 하나가되었습니다. 그것은 내 뇌가보고 거부 반복을 잡는 삼십초 패스입니다, 실제로 페이지가 주장하는 주제를 언급 확인, 때때로 세 가지 다른 초안에서 조립 된 것처럼 읽는 무언가를 게시에서 저를 저장. 이 가이드는 내가 잘 단어를 계산에 대해 배운 모든 것입니다.

TL;DR: 단어 빈도 카운터는 단어를 텍스트 분할 및 보고 얼마나 많은 시간을 각 하나 나타나는 가장에서 가장 덜 일반적인 순위가. 그것을 사용 하 여 과도 한 사용 목발 단어를 잡으려고,SEO 에 대 한 키워드 밀도를 확인 하 고 문서가 실제로 강조 하는 것을 이해. 접어 케이스 그래서 "The" 및 "the" 함께 카운트,중지 단어 필터를 켜서 "the"와 같은 기능 단어를 숨기기 및 "and," 및 백분율 열을 읽고 각 word's 텍스트의 공유를 참조 하십시오. 그만큼 단어 주파수 카운터 브라우저에서 완전히 실행되므로 붙여넣는 항목이 업로드되지 않습니다.

단어 주파수 카운터 란 무엇입니까?

단어 빈도 카운터는 텍스트 블록을 읽고 이를 개별 단어로 나눕니다 유니코드 표준 부록 #29 spaces&quot 에 "split 보다 훨씬 더 신중하게 지정합니다; 제안 - 그리고 각각의 구별되는 단어가 몇 번 나타나는지 알려줍니다. 출력은 순위표입니다: 모든 고유 단어,그 개수,그리고 일반적으로 전체 문서의 백분율입니다. 가장 자주 나타나는 단어는 맨 위에 있습니다.

이것은 평범한 단어 카운터가 대답하는 질문과는 다른 질문입니다. A 단어 카운터 문서에 847 개의 단어가 있음을 알려줍니다. 주파수 카운터는 그 단어 중 31 개가 "the, " 12 개는 "data, " 그리고 9 개는 "however." 총계는 길이에 대한 하나의 숫자입니다. 주파수 테이블은 강조에 대한 분포입니다. 길이는 할당 대상을 맞추었는지 여부를 알려줍니다. 분포는 글이 실제로 무엇에 관한 것인지,어디에서 반복되는지 알려줍니다.

개념은 오래되고 잘 연구되었습니다. 언어 학자들은 한 세기 이상 동안 단어 빈도를 측정했으며,나타나는 패턴은 언어간에 현저하게 일관됩니다: 소수의 단어가 모든 텍스트에서 엄청난 부분을 차지하고,그 후 빈도가 급격히 떨어집니다. 이것은 Zipf & # 39;s 법칙으로,가장 일반적인 단어가 두 번째로 가장 일반적인 단어보다 약 2 배,세 번째 단어보다 3 배 자주 나타나는 경향이 있다는 관찰입니다. 빈도별로 문서를 정렬하는 순간 자신의 글에서이 모양을 볼 수 있습니다. 목록의 상단은 짧은 기능 단어가 지배적이며 흥미로운 내용 단어는 그 뒤에 추적됩니다.

왜 단어 빈도를 계산합니까?

나는 네 가지 뚜렷한 이유로 빈도 분석에 도달하며, 표를 읽기 전에 어느 것을 쫓고 있는지 아는 것이 도움이 됩니다.

첫 번째는 반복을 잡는 것입니다. 모든 작가는 목발 단어,눈치 채지 않고 기대는 단어를 가지고 있습니다. 내 것은 & quot;기본적으로,& quot; & quot;실제로, & quot; 그리고 & quot;just.& quot; 당신의 것은 & quot;really,& quot; & quot;very,& quot; 또는 당신이 사랑에 빠진 특정 기술 용어 일 수 있습니다. 반복은 별도의 순간에 각 인스턴스를 썼고 쌓인 것을 보지 못했기 때문에 내부에서 보이지 않습니다. 주파수 카운트가 그들을 쌓아 올립니다.

두 번째는 검색을 위한 키워드 밀도입니다. 특정 문구를 대상으로 페이지를 작성할 때,페이지가 채워진 것으로 읽힐 정도로 자주 나타나지 않고 검색 엔진이 주제를 이해할 수 있을 만큼 문구와 그 가까운 변형이 자주 나타나는지 확인하고 싶습니다. 백분율 열은 이것을 막연한 걱정에서 확인할 수 있는 숫자로 바꿉니다.

세 번째는 익숙하지 않은 문서를 이해하는 것입니다. 긴 보고서,성적표 또는 경쟁자's 기사에 붙여넣고 빈도별로 정렬하고 기능 단어를 필터링하면 목록의 맨 위에 약 10 초 안에 주제에 대한 공정한 요약입니다. 조잡한 요약이지만 빠르고 정직합니다.

네 번째는 다양성을 위한 편집입니다. "important"가 열한 번 나오면 그 중 일부는 동의어 또는 삭제 후보입니다. 카운트는 어떤 것을 변경해야 하는지 알려주지 않지만 보라고 알려줍니다.

Word 주파수 카운터를 어떻게 사용합니까?

워크플로가 짧습니다. 의 입력 상자에 텍스트를 붙여넣습니다 단어 주파수 카운터그리고,순위표가 바로 뜨게 됩니다. 업로드 단계도 없고 기본 카운트를 기다릴 버튼도 없습니다.

거기에서 옵션은 보이는 것을 형성합니다. 대소문자가 중요한지 결정합니다. 대소문자 접기를 원하는 대부분의 쓰기의 경우 기본값은 "Data," "data," and "DATA" count as one word rather three. 순위가 문법 대신 내용 단어를 표면화하기를 원할 때 중지 단어 필터를 켭니다. 매우 짧은 토큰을 건너 뛰기 위해 최소 단어 길이를 설정합니다. 그리고 목록의 꼬리가 길고 흥미롭지 않은 경우 읽을 가치가있는 단어로 트리밍하기 위해 top-N 제한을 설정합니다.

원하는 뷰가 있으면 테이블을 복사합니다. 탭으로 구분된 행으로 복사합니다. 즉,재포맷하지 않고 스프레드시트 열이나 문서 테이블에 깔끔하게 붙여넣습니다. 시간이 지남에 따라 개선되고 있는지 확인할 수 있도록 기사에 걸쳐 목발 단어 수를 작은 스프레드시트로 보관하고 탭으로 구분된 내보내기가 바로 그 안에 떨어집니다.

중지 단어란 무엇이며 제거해야 합니까?

정지어는 문장을 함께 잡고 있지만 그 자체로는 거의 화제적 의미를 지니지 않는 고주파 함수어이다: "the,"a,"a,"and,"of," "to," "is," "in," and their many companions. 거의 모든 영어 문서에서 이 단어들은 원시 주파수 목록의 상단을 지배한다. 필터링 없이 천 단어짜리 기사를 세어보면 처음 여섯 개나 일곱 개의 행은 정지어가 될 것이고,기사가 실제로 다루고 있는 단어는 그 아래에 묻혀질 것이다.

그것들을 제거할 지 여부는 전적으로 목표에 달려 있습니다. 문법을 제거하면 내용 단어가 그대로 유지되기 때문에 문서가 무엇인지 확인하려고 할 때 필터를 켜십시오. 예를 들어 문장 구조를 연구하거나 실제 길이를 측정하거나 "however" 또는 "moreover."와 같은 특정 연결어를 얼마나 자주 과도하게 사용하는지 확인할 때 모든 토큰의 정확하고 필터링되지 않은 개수가 필요할 때 필터를 끄십시오

영어 중지 단어의 단일 공식 목록은 없습니다. 다른 도구와 라이브러리는 약간 다른 세트를 제공하며 선택은 표준이 아닌 판단 호출입니다. 이 도구는 널리 사용되는 일반적인 영어 함수 단어의 컴팩트한 목록을 사용합니다. 의미 있다고 생각하는 단어가 필터링되는 경우 이는 주제가 함수 단어 세트와 겹치는 기호이므로 특정 카운트에 대해 필터를 꺼야 합니다.

수축, 하이픈 및 기타 언어는 어떻게 처리됩니까?

단어 분할은 자세히 보기 전까지는 사소한 것처럼 들리지만,그러면 가장자리 케이스의 둥지가 됩니다. 한 단어로 계산되는 것은 무엇입니까?

이 도구는 유니코드 문자와 숫자로 분할되며 두 문자 또는 숫자 실행 사이에 위치할 때 아포스트로피 또는 하이픈을 유지합니다. 이 단일 규칙은 가장 중요한 경우를 처리합니다. 수축 "don't" "don" 및 "t." 화합물 "state-of-the-art" 모든 하이픈에서 4개의 조각으로 부서지는 대신 그대로 유지됩니다. 그러나 대시로 사용되는 길 잃은 하이픈이나 따옴표로 사용되는 후행 아포스트로피는 반대편에 문자가 없기 때문에 이웃 단어에 붙지 않습니다.

매칭이 유니코드 인식이기 때문에 악센트가 있고 라틴어가 아닌 스크립트도 작동합니다. "Café"는 악센트가 그대로 유지된 한 단어로 계산되며,라틴어가 아닌 문자를 사용하는 언어의 텍스트는 삭제되지 않고 동일한 문자와 숫자 규칙으로 분할됩니다. 숫자는 단어로 처리되므로 "2026" 및 "42" 표에 나타납니다. 숫자가 노이즈인 산문을 계산하는 경우 최소 길이 옵션과 빠른 스캔을 통해 무시할 수 있습니다.

키워드 밀도란 무엇이며, 이 도구는 이를 어떻게 표시합니까?

키워드 밀도는 백분율로 작성된 전체 단어 수의 word's 몫입니다. 500 단어 페이지가 대상 키워드를 10 번 사용하는 경우 밀도는 2 퍼센트입니다. 빈도 카운터는 각 카운트 옆의 백분율 열에 이를 표시하므로 직접 나눗셈을 할 필요가 없습니다.

SEO 조언의 정직한 버전은 다음과 같습니다: 페이지 순위를 매기는 마법의 밀도 번호는 없으며 결코 없었습니다. 검색 엔진은 수년 전에 원시 키워드 반복에 대한 보상을 중단했으며 Google's 자체 지침은 키워드 채우기에 대해 구체적으로 경고합니다. 순위를 조작하기 위해 페이지에 용어를 벼락치기하는 관행. 밀도가 진정으로 유용한 것은 반대 확인입니다. 페이지가 해당 주제를 전혀 언급하고 있음을 확인하고 실수로 문구를 반복하여 인간 독자가 알아 차리고 검색 엔진이 스팸으로 취급 할 수있는 페이지를 플래그 지정합니다. 나는 그것을 표적이 아닌 연기 탐지기로 사용합니다.

아래 표는 내가 배우려는 내용에 따라 주파수 수가 제공하는 다양한 신호를 읽는 방법을 보여줍니다.

목표 무엇을 볼 것인가 도움이 되는 설정 나쁜 결과는 어떤 모습인가
목발 단어를 잡아라 놀라울 정도로 높은 수치를 지닌 내용의 단어 케이스를 접고 말을 중단하세요 짧은 조각에 비공식 단어 하나가 10+ 번 나타납니다
키워드 밀도 확인 대상 구문의 백분율 열입니다 케이스 접기 0.5 퍼센트 이하, 또는 4~5 퍼센트 이상의 단어 한 개를 대상으로 합니다
문서를 요약합니다 상위 10 ~ 15 행 단어를 중지하고 최소 길이 3 아무것도, 이것은 필터가 무엇을 위해
다양성을 위해 편집 개수가 많은 모든 콘텐츠 단어 말을 멈추세요 모든 단락에서 동일한 형용사가 반복됩니다
실제 길이를 측정합니다 총 단어 수 모든 필터가 꺼집니다 목표에서 멀리 떨어진 카운트

단어 빈도 카운터 대 일반 단어 카운터

이 두 도구는 이름이 겹치기 때문에 끊임없이 혼란스러워하므로 그 차이를 분명히 말할 가치가 있습니다. 단어 카운터는 "how much?" totals: 단어,문자, 문장,때로는 읽기 시간을 반환합니다. 길이 목표,트윗 제한 또는 에세이 최소값이있을 때 올바른 도구입니다. 단어 빈도 카운터는 "which words,and how often?" 분포를 반환하며 길이보다는 강조,반복 또는 밀도에 신경 쓸 때 올바른 도구입니다.

그들은 잘 짝을 이룹니다. 저는 보통 드래프트를 통해 실행합니다 단어 카운터 길이를 확인하려면 주파수 카운터를 통해 길이가 동일한 세 단어로 채워지지 않았는지 확인하세요. 산문이 아닌 목록도 작업하는 경우 라인 분류기 중복을 제거하고 라인을 주문합니다 텍스트 차이 검사기 는 문서의 두 버전 사이에서 정확히 무엇이 바뀌었는지 보여줄 것입니다. 그리고 만약 당신의 편집의 목표가 단어 선택을 변화시키는 것이라면,the 케이스 컨버터 변경 사항을 결정한 후 제목과 식별자를 재구성하는 기계적 부분을 처리합니다.

내 텍스트는 비공개인가요?

예. 전체 분석은 자바스크립트를 사용하여 브라우저에서 이루어집니다. 붙여넣는 텍스트는 서버로 전송되지 않으며,기록되지도 않고,저장되지도 않습니다. 이것은 들리는 것보다 더 중요합니다. 왜냐하면 분석할 가치가 가장 높은 문서는 종종 업로드하고 싶지 않은 문서이기 때문입니다: 미발표 원고,client's 기밀 보고서,내부 메모,금수 조치 중인 초안.

당신은 그것을 위해 내 말을 할 필요가 없습니다. 귀하의 browser's 네트워크 탭을 열고 당신이 계산 하는 동안 그것을 보고,당신은 어떤 요청이 나가지 않는 것을 볼 수 있습니다. 또는 인터넷에서 완전히 연결을 끊고 계속 작동,페이지가 로드 되 면,도구는 전혀 연결이 필요 하지 않기 때문에. 이 브라우저 우선 접근 방식은 내가 구축 하는 모든 뒤에 같은 원리 이며,주제가 관심을 끌 경우,나는에 그것에 대해 더 썼다 온라인 도구를 통한 데이터 개인 정보 보호 가이드. 주파수 카운터가 쓰기 및 편집 작업 흐름에 적합한 위치를 더 자세히 보려면 다음과 같습니다 개발자 생산성 도구 가이드 내가 가장 많이 도달하는 도구를 다룹니다.

자주 묻는 질문

단어 빈도란 무엇입니까?

단어 빈도는 각 별개의 단어가 텍스트에 나타나는 횟수입니다. 단어 빈도 카운터는 순위표로 보고하며, 고유한 모든 단어가 포함된 모든 단어와 종종 전체의 백분율을 나열하므로 가장 많이 사용되는 단어가 맨 위에 표시됩니다.

단어가 얼마나 자주 표시되는지 어떻게 계산합니까?

텍스트를 도구에 붙여넣고 각 단어를 해당 수로 나열하는 순위표를 읽으십시오. 한 단어에 초점을 맞추려면 알파벳순으로 정렬하거나 표를 스캔합니다. 모든 발생이 계산되고 대소문자 접기가 기본적으로 켜져 있으므로 대문자와 소문자가 함께 계산됩니다.

중지 단어는 무엇이며 제거해야 합니까?

STOP 단어는,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,, 그것들을 제거하는 것은 선택 사항입니다. 문서의 내용을 표시하려면 필터를 켜고, 모든 단어에 대해 필터링되지 않은 정확한 개수가 필요할 때는 그대로 두십시오.

카운터는 대문자와 소문자를 같은 단어로 취급합니까?

기본적으로 그렇습니다. 대소문자를 ON으로 하면 한 단어로 계산됩니다. 대소문자 구분 모드를 켜십시오. 예를 들어, 보통 단어로 사용된 동일한 문자와 고유 명사를 따로 세는 것과 같이 대문자가 중요합니다.

수축과 하이픈으로 연결된 단어는 어떻게 처리됩니까?

단어는 유니코드 문자와 숫자로 분할되지만 두 문자 또는 숫자 실행 사이의 아포스트로피 또는 하이픈은 유지됩니다. 따라서 don't 는 두 단어가 아닌 한 단어로 계산되며,최첨단 기술은 모든 하이픈에서 깨지는 대신 단일 토큰으로 유지됩니다.

키워드 밀도란 무엇이며 이 도구는 이를 어떻게 보여줍니까?

키워드 밀도는 백분율로 표시되는 전체 단어 수의 word's 몫입니다. 도구는 각 카운트 옆의 백분율 열에 표시하므로 키워드 채우기 지점까지 반복하지 않고도 대상 구문이 관련성이 있을 만큼 자주 나타나는지 확인할 수 있습니다.

내가 분석할 수 있는 텍스트의 양에 제한이 있습니까?

고정된 크기 제한이 없습니다. 분석은 서버가 아닌 브라우저에서 실행되기 때문에 장치 메모리에만 연결되므로 전체 기사와 책 길이의 원고는 업로드 한도 없이 처리됩니다.

내 텍스트가 어디에나 업로드되어 있습니까?

...이 아닌 . 텍스트는 브라우저에서 실행 중인 JavaScript에 의해 분석되며 전송, 기록 또는 저장되지 않습니다. 계산하는 동안 네트워크 탭을 보거나 인터넷 연결을 끊고 오프라인에서 도구가 계속 작동하여 이를 확인할 수 있습니다.


[Toolz.dev](/.의 빌더인 Liton이 작성하였습니다. 저는 브라우저 기반의 개발자 도구를 만들고, 그것을 만드는 기술에 대해 씁니다.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!