Command Palette

Search for a command to run...

מונה תדרי מילים: כיצד למצוא את המילים הנפוצות ביותר שלך (ולמה זה חשוב)

מונה תדרי מילים: כיצד למצוא את המילים הנפוצות ביותר שלך (ולמה זה חשוב)

T
Toolz Team
|Aug 23, 2026|15 קריאה דקות

חלק מאוסף כלי טקסט

בפעם הראשונה שהרצתי את אחד הפוסטים שלי בבלוג דרך מונה תדרים של מילים, הרגשתי קצת חשוף השתמשתי במילה " בעיקרון" ארבע עשרה פעמים במאמר בן 1,200 מילים. לא " מדי פעם" ארבע עשרה פעמים. ארבע עשרה. העיניים שלי הבהיקו ממש מעל כל אחת מהן בזמן הכתיבה, כי זה בדיוק מה שעושות מילות קביים: הן מסתתרות לעין. ספירת תדרים לא אכפת מהכוונות שלך. זה פשוט נחשב, והמספר יושב שם על המסך ומעז אותך להתווכח עם זה.

אני בונה כלים ב [Toolz.dev] (/, ואני מבלה את רוב השבוע שלי בכתיבה: תיעוד עבור תוספי וורדפרס, עותק שיווקי, מדריכים של Laravel, הערות שחרור ניתוח תדר מילים הפך בשקט לאחד הבדיקות שאני מריץ לפני כל דבר נשלח זה מעבר שלושים שניות שתופס חזרה שהמוח שלי מסרב לראות, מאשר שדף מזכיר למעשה את הנושא שהוא מתיימר להיות עליו, ומדי פעם חוסך ממני לפרסם משהו שקורא כאילו הוא הורכב משלוש טיוטות שונות המדריך הזה הוא כל מה שלמדתי על ספירת מילים היטב.

TL;DR: מונה תדירות מילים מפצל את הטקסט שלך למילים ומדווח כמה פעמים כל אחת מופיעה, מדורגת מהרוב לפחות נפוץ. השתמש בו כדי לתפוס מילות קביים בשימוש יתר, בדוק את צפיפות מילות המפתח עבור SEO, והבין מה מסמך מדגיש בפועל. Fold case so "The" ו-"the" לספור יחד, להפעיל את מסנן מילות העצירה כדי להסתיר מילות פונקציה כמו "the" ו-"and," וקרא את עמודת האחוזים כדי לראות כל מילה 's חלק מהטקסט. ה מונה תדרים של מילים פועל כולו בדפדפן שלך, כך ששום דבר שאתה מדביק לא מועלה.

מה זה מונה תדרים של מילים?

מונה תדר מילים קורא גוש טקסט, מפרק אותו למילים בודדות - צעד נספח תקן Unicode #29 מציין הרבה יותר בזהירות מאשר " מפוצל על רווחים" מציע - ואומר לך כמה פעמים מופיעה כל מילה נפרדת הפלט הוא טבלה מדורגת: כל מילה ייחודית, הספירה שלה, ובדרך כלל האחוז שלה מכל המסמך המילה שמופיעה לרוב יושבת בראש.

זו שאלה שונה מזו שעונה מונה מילים פשוטות. א מונה מילים אומר לך שבמסמך יש 847 מילים מונה תדרים אומר לך ש-31 מהמילים האלה הן "the," 12 הם "data," ו-9 הם "however." הסכום הכולל הוא מספר אחד בערך אורך טבלת התדרים היא התפלגות לגבי הדגשה אורך אומר לך אם פגעת ביעד הקצאה ההפצה אומרת לך על מה בעצם הכתיבה והיכן היא חוזרת על עצמה.

המושג ישן ונחקר היטב בלשנים מדדו תדירויות מילים במשך יותר ממאה שנה, והתבנית שמופיעה עקבית להפליא בין השפות: מספר קטן של מילים מהוות נתח עצום מכל טקסט, והתדירות יורדת בחדות לאחר מכן זהו Zipf's חוק, התצפית שהמילה הנפוצה ביותר נוטה להופיע בערך פי שניים מהשנייה בשכיחותה, פי שלושה מהשלישית וכן הלאה, תראה את הצורה הזו בכתיבה שלך ברגע שאתה ממיין מסמך לפי תדירות, בראש הרשימה שולטים מילות פונקציה קצרות, ומילות התוכן המעניינות נגררות מאחוריהן.

למה שאספור תדירות מילים?

אני מושיט יד לניתוח תדרים מארבע סיבות ברורות, וזה עוזר לדעת אחרי איזו מהן אתה רודף לפני שאתה קורא את הטבלה.

הראשון הוא חזרה תופסת לכל כותב יש מילות קביים, אלה שהם נשענים עליהם בלי לשים לב שלי הם " בעיקרון, " " למעשה, " ו "just." שלך עשוי להיות "באמת, " "very," או מונח טכני מסוים שהתאהבת בו. Repetition הוא בלתי נראה מבפנים כי כתבת כל מופע ברגע נפרד ומעולם לא ראית אותם מוערמים ספירת תדרים עורמת אותם.

השני הוא צפיפות מילות מפתח לחיפוש כשאני כותב דף המכוון לביטוי ספציפי, אני רוצה לאשר את הביטוי והגרסאות הקרובות שלו מופיעות לעתים קרובות מספיק כדי שמנוע חיפוש יבין את הנושא, מבלי להופיע לעתים קרובות כל כך עד שהעמוד נקרא כממולא עמודת האחוזים הופכת את זה מדאגה מעורפלת למספר שאני יכול לבדוק.

השלישי הוא הבנת מסמך לא מוכר הדבק בדוח ארוך, תמליל, או מתחרה's מאמר, מיין לפי תדירות, סנן את מילות הפונקציה, וראש הרשימה הוא סיכום הוגן של הנושא בתוך כעשר שניות זהו סיכום גס, אבל הוא מהיר וכנה.

הרביעי הוא עריכה למגוון. אם "important" מופיע אחת עשרה פעמים, חלקם מועמדים למילה נרדפת או למחיקה. הספירה לא אומרת לך אילו לשנות, אבל היא אומרת לך להסתכל.

כיצד אוכל להשתמש במונה התדרים של Word?

זרימת העבודה קצרה הדבק את הטקסט שלך בתיבת הקלט ב- מונה תדרים של מילים, והטבלה המדורגת מופיעה מיד אין שלב העלאה ואין כפתור לחכות לספירה הבסיסית.

משם, האפשרויות מעצבות את מה שאתה רואה החלט אם המקרה חשוב לרוב הכתיבה אתה רוצה קיפול מקרה, ברירת המחדל, כך ש "Data," "data," ו "DATA" לספור כמילה אחת ולא שלוש הפעל את מסנן מילות העצירה כאשר אתה רוצה שהדירוג יעלה מילות תוכן במקום דקדוק הגדר אורך מילה מינימלי כדי לדלג על אסימונים קצרים מאוד ואם הזנב של הרשימה ארוך ולא מעניין, הגדר גבול עליון N כדי לקצץ אותו למילים ששווה לקרוא.

כאשר יש לך את התצוגה הרצויה, העתק את הטבלה. זה מעתיק כשורות מופרדות בכרטיסיות, מה שאומר שהוא מדביק בצורה נקייה לעמודה של גיליון אלקטרוני או לטבלת מסמכים ללא כל עיצוב מחדש. אני שומר גיליון אלקטרוני קטן של ספירת מילות קביים על פני מאמרים כדי שאוכל לראות אם אני משתפר עם הזמן, והיצוא המופרד בכרטיסיות יורד ישר לתוכו.

מהן מילות עצירה, והאם עלי להסיר אותן?

מילות עצירה הן מילות הפונקציה בתדר גבוה שמחזיקות משפטים יחד אך כמעט ואינן נושאות משמעות אקטואלית בפני עצמן: "the," "a," "and," "of," "to," "is," "in," ומלווין הרבים כמעט בכל מסמך באנגלית, מילים אלו שולטות בראש רשימת תדרים גולמית אם סופרים מאמר בן אלף מילים ללא סינון, שש או שבע השורות הראשונות יהיו מילות עצירה, והמילים שהמאמר עוסק בהן למעשה ייקברו מתחתיהן.

האם להסיר אותם תלוי לחלוטין במטרה שלך הפעל את המסנן כאשר אתה מנסה לראות על מה מסמך, כי הפשטת הדקדוק משאירה את מילות התוכן עומדות השאר אותו כבוי כאשר אתה צריך ספירה מדויקת ולא מסוננת של כל אסימון, למשל כאשר אתה לומד מבנה משפט, מדידת אורך אמיתי או בדיקת התדירות שבה אתה משתמש יתר על המידה בחיבור ספציפי כמו "however" או "moreover."

אין רשימה רשמית אחת של מילות עצירה באנגלית כלים וספריות שונות משלוחות סטים שונים במקצת, והבחירה היא קריאת שיפוט ולא תקן כלי זה משתמש ברשימה קומפקטית בשימוש נרחב של מילות פונקציה נפוצות באנגלית אם מילה שאתה מחשיב כמשמעותית עוברת סינון, זה סימן שהנושא שלך חופף לסט מילות הפונקציה, ועליך לכבות את המסנן עבור הספירה המסוימת הזו.

כיצד מטפלים בהתכווצויות, מקפים ושפות אחרות?

פיצול מילים נשמע טריוויאלי עד שמסתכלים מקרוב, ואז זה הופך לקן של מקרי קצה מה נחשב למילה אחת?

כלי זה מתפצל על אותיות וספרות Unicode, והוא שומר אפוסתרוף או מקף כאשר הוא יושב בין שתי אותיות או מספר פועל. הכלל היחיד הזה מטפל במקרים החשובים ביותר. הכיווץ "don't" נשאר מילה בודדת במקום להתפצל ל-"don" ו-"t." התרכובת "state-of-the-art" נשאר שלם במקום להתנפץ לארבעה שברים בכל מקף. אבל מקף תועה המשמש כמקף, או אפוסתרוף נגרר המשמש כמרכאת, אינו מודבק על מילה שכנה, כי אין אות בצד השני שלה.

מכיוון שההתאמה מודעת ל-Unicode, סקריפטים מודגשים ולא לטיניים עובדים גם הם. "Café" נחשב כמילה אחת עם המבטא שלה שלם, וטקסט בשפות המשתמשות באותיות לא לטיניות מפוצל על אותו כלל אותיות וספרות במקום להישמט. מתייחסים למספרים כמילים, אז "2026" ו-"42" מופיעים בטבלה. אם אתה סופר פרוזה שבה הספרות הן רעש, אפשרות האורך המינימלי וסריקה מהירה יאפשרו לך להתעלם מהם.

מהי צפיפות מילות מפתח, וכיצד הכלי הזה מראה אותה?

צפיפות מילות מפתח היא מילה's נתח של ספירת המילים הכוללת, נכתב באחוזים אם דף בן 500 מילים משתמש במילת המפתח היעד שלך 10 פעמים, הצפיפות שלו היא 2 אחוזים מונה התדרים מציג זאת בעמודה אחוזים ליד כל ספירה, כך שלעולם לא תצטרך לבצע את החלוקה בעצמך.

הנה הגרסה הכנה של העצה לקידום אתרים: אין מספר צפיפות קסם שמדרג דף, ומעולם לא היה מנועי החיפוש הפסיקו לתגמל חזרה גולמית על מילות מפתח לפני שנים רבות, ו-Google' ההנחיה של עצמו מזהירה במיוחד מפני מילוי מילות מפתח, התרגול של דחיסת מונח על דף כדי לתמרן דירוגים. איזו צפיפות באמת שימושית היא הבדיקה ההפוכה. זה מאשר שדף מזכיר את הנושא שלו בכלל, והוא מסמן את הדפים שבהם חזרת בטעות על ביטוי כל כך הרבה פעמים שקורא אנושי ישים לב ומנוע חיפוש עשוי להתייחס אליו כאל דואר זבל. אני משתמש בו כגלאי עשן, לא כמטרה.

הטבלה שלהלן מראה כיצד אני קורא את האותות השונים שספירת תדרים נותנת, בהתאם למה שאני מנסה ללמוד.

מטרה על מה להסתכל הגדרה שעוזרת איך נראית תוצאה גרועה
לתפוס מילות קביים מילות תוכן עם ספירות גבוהות באופן מפתיע תיק מתקפל, עצור מילים כבויות מילה אחת לא רשמית מופיעה 10+ פעמים ביצירה קצרה
בדוק את צפיפות מילות המפתח עמודת אחוז עבור ביטוי היעד שלך מארז מתקפל על יעד מתחת ל-0.5 אחוז, או מילה בודדת מעל 4 עד 5 אחוזים
סכמו מסמך 10 עד 15 שורות מובילות עצור מילים על, אורך מינימלי 3 כלום, בשביל זה יש את הפילטר
ערוך למגוון כל מילת תוכן עם ספירה גבוהה עצור מילים על אותו שם תואר חוזר על פני כל פסקה
מדוד אורך אמיתי נתון סך המילים כל המסננים כבויים ספירה רחוקה מהמטרה שלך

מונה תדר מילים מול מונה מילים פשוטות

שני כלים אלה מתבלבלים ללא הרף כי השמות שלהם חופפים, אז כדאי לציין את ההבדל בצורה ברורה מונה מילים עונה "כמה?" זה מחזיר סכומים: מילים, תווים, משפטים, לפעמים זמן קריאה זה הכלי הנכון כאשר יש לך יעד אורך, מגבלת ציוץ, או מינימום חיבור מונה תדירות מילים עונה " אילו מילים, ובאיזו תדירות?" זה מחזיר התפלגות, וזה הכלי הנכון כאשר אכפת לך מהדגשה, חזרה או צפיפות ולא אורך.

הם מזדווגים היטב אני בדרך כלל מריץ טיוטה דרך ה מונה מילים כדי לאשר אורך, אז דרך מונה התדרים לבדוק שהאורך לא מרופד באותן שלוש מילים אם אתה עובד גם עם רשימות ולא עם פרוזה, ה סדרן קו ישכפל ויזמין שורות, וה בודק הבדל טקסט יראה לך בדיוק מה השתנה בין שתי גרסאות של מסמך ואם המטרה של העריכה שלך היא לשנות את בחירת המילים, ה ממיר מארז מטפל בחלק המכני של עיצוב מחדש של כותרות ומזהים לאחר שהחלטת מה לשנות.

האם הטקסט שלי פרטי?

כן כל הניתוח קורה בדפדפן שלך באמצעות JavaScript הטקסט שאתה מדביק לעולם לא נשלח לשרת, לעולם לא נרשם, ולעולם לא מאוחסן זה חשוב יותר ממה שזה נשמע, כי המסמכים שהכי שווה לנתח הם לרוב אלה שאתה הכי פחות רוצה להעלות: כתב יד שלא פורסם, לקוח' דוח סודי, תזכיר פנימי, טיוטה תחת אמברגו.

אתה לא צריך לקחת את המילה שלי על זה פתח את הדפדפן שלך's לשונית רשת ולצפות בו בזמן שאתה סופר, ותראה כי לא יוצאת בקשה או להתנתק מהאינטרנט לחלוטין ולהמשיך לעבוד, כי ברגע שהדף נטען, הכלי לא צריך חיבור בכלל גישה זו של דפדפן ראשון היא אותו עיקרון מאחורי כל מה שאני בונה, ואם הנושא מעניין אותך, כתבתי על זה יותר ב מדריך לפרטיות נתונים עם כלים מקוונים. לתמונה רחבה יותר של היכן מונה תדרים משתלב בזרימת עבודה של כתיבה ועריכה, ה מדריך כלי פרודוקטיביות למפתחים מכסה את הכלים אליהם אני מגיע לרוב.

שאלות נפוצות

מהי תדירות מילים?

תדירות מילים היא מספר הפעמים שכל מילה נפרדת מופיעה בקטע טקסט. מונה תדירות מילים מדווח על טבלה מדורגת, ומפרט כל מילה ייחודית עם הספירה שלה ולעתים קרובות את האחוז שלה מהשלם, כך שהמילים הנפוצות ביותר מופיעות בראש.

איך אני סופר באיזו תדירות מופיעה מילה?

הדבק את הטקסט שלך בכלי וקרא את הטבלה המדורגת, שמפרטת כל מילה עם הספירה שלה. כדי להתמקד במילה אחת, מיין בסדר אלפביתי או סרוק את הטבלה עבורה. כל מופע נספר, וקיפול המקרים מופעל כברירת מחדל, כך שהטפסים באותיות גדולות וקטנים נחשבים יחד.

מהן מילות עצור והאם עלי להסיר אותן?

מילות עצירה הן מילות פונקציה בתדירות גבוהה כגון, ו-of, to, והן נושאות מעט משמעות אקטואלית. הסרתם היא אופציונלית. הפעל את המסנן כאשר אתה רוצה שהדירוג יצוץ את מילות התוכן שמסמך נמצא עליהן; השאר אותו כבוי כאשר אתה צריך ספירה מדויקת ולא מסוננת של כל מילה.

האם המונה מתייחס לאותיות רישיות וקטנות כאל אותה מילה?

כברירת מחדל, כן. קיפול המארז הוא על, אז ה, וה- ו- הם נחשבים כמילה אחת. הפעל מצב תלוי רישיות כאשר היוון חשוב, למשל לספור שם עצם נכונים בנפרד מאותן אותיות המשמשות כמילה רגילה.

כיצד מטפלים בהתכווצויות ומילים ממוקפות?

מילים מפוצלות על אותיות וספרות Unicode, אבל אפוסתרוף או מקף בין שתי אותיות או מספר פועל. אז don' t נחשב כמילה אחת ולא שתיים, והחדשנות נשארת אסימון בודד במקום להישבר בכל מקף.

מהי צפיפות מילות מפתח וכיצד הכלי הזה מראה זאת?

צפיפות מילות מפתח היא מילה & #39;s נתח של ספירת המילים הכוללת, מבוטא באחוזים הכלי מציג את זה בעמודה אחוזים ליד כל ספירה, כך שתוכל לבדוק אם ביטוי יעד מופיע לעתים קרובות מספיק כדי להיות רלוונטי מבלי לחזור על עצמו עד לנקודה של מילוי מילות מפתח.

האם יש הגבלה על כמה טקסט אני יכול לנתח?

אין מגבלת גודל קבועה. מכיוון שהניתוח פועל בדפדפן שלך ולא בשרת, אתה מחויב רק לזיכרון המכשיר שלך, כך שמאמרים מלאים וכתבי יד באורך הספר מטופלים ללא מכסה העלאה.

האם הטקסט שלי מועלה במקום כלשהו?

לֹא . הטקסט מנותח על ידי JavaScript הפועל בדפדפן שלך ולעולם אינו משודר, נרשם או מאוחסן. אתה יכול לאשר זאת על ידי צפייה בכרטיסייה רשת בזמן שאתה סופר, או על ידי ניתוק מהאינטרנט, הכלי ממשיך לעבוד במצב לא מקוון.


נכתב על ידי ליטון, בונה של [Toolz.dev] (/. אני מייצר כלי מפתחים מבוססי דפדפן וכותב על מלאכת בנייתם.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!