Coherent Transcript Editor - עריכה קוהרנטית נאמנה
<SKILL_DIR> = התיקייה שמכילה את קובץ ה-SKILL.md הזה (בדרך כלל
~/.claude/skills/coherent-transcript-editor). לפתור לנתיב מוחלט פעם אחת לפני
הרצת פקודות - PowerShell/cmd לא מרחיבים ~ בתוך מרכאות.
מטרה: להפוך תמלול גולמי של שיחה / דו-שיח / פאנל / ראיון / דיון (לרוב תמלול אוטומטי
עם חותמות זמן, מילות מילוי ושיבושי תמלול) למסמך עברי קריא וזורם - תוך
שמירה נאמנה על כל מילה של כל דובר ("ככתבה וכלשונה").
עיקרון יסוד: עריכה קוהרנטית, לא סיכום ולא כתיבה מחדש
זו עריכה קוהרנטית בלבד. לא סיכום, לא קיצור, לא פרפראזה, לא ארגון-מחדש כמסה,
ולא איחוד הדוברים לקול אחד. ההיקף של התוצר ≈ היקף המקור.
מותר ורצוי:
- להסיר חותמות זמן (
0:06, 1 דקה, 4 שניות), גמגומים, וכפילויות-מילוליות
- לתקן פיסוק, לחלק לפסקאות
- לתקן שיבושי תמלול: מילים משובשות, שמות, ציטוטים שהמכונה סילפה
- לסמן מי מדבר (תוויות דובר מודגשות) ולהוסיף כותרות נושא קלות (H2)
אסור:
- להשמיט נושא, רעיון, סיפור, בדיחה או הערת-אגב
- לקצר או "לדלג על החלק הפחות חשוב"
- לנסח מחדש משפט באופן שמשנה משמעות או טון
- לשנות עמדה של דובר, או לאחד שני דוברים לקול אחד
- לכתוב בגוף ראשון אחיד - כל דובר נשאר בגוף ראשון שלו (זו ההבחנה מ-
shiur-editor)
הבחנה מ-shiur-editor (חשוב)
|
coherent-transcript-editor (זה) |
shiur-editor |
| קלט |
דו-שיח / פאנל / ראיון / דיון, או דובר-יחיד שצריך נאמנות מילולית |
דרשה / שיעור של דובר יחיד |
| גוף |
גוף ראשון של כל דובר בנפרד, עם תוויות דובר |
גוף ראשון אחיד (כאילו המשתמש מעביר) |
| מבנה |
פסקאות נאמנות + כותרות נושא; בלי ארגון-מחדש |
היררכיה לוגית מאורגנת מחדש |
| נאמנות |
"כלשונה" - כל מילה, כל אסיד, כל בדיחה |
שמירת כל הנושאים, אך מנוסח מחדש בחופשיות |
אם המשתמש מבקש דרשה של דובר-יחיד מאורגנת ומנוסחת מחדש - השתמש ב-shiur-editor.
תוויות דובר (Speaker labels)
לתמלול אוטומטי אין סימוני דובר - יש להסיק את המעברים מההקשר:
- מי פותח / מנחה / מציג את עצמו, מי שואל ומי עונה, מטבעות-לשון אישיים, "אני אספר", "תשמע".
- כל מעבר דובר נפתח בתווית מודגשת בתחילת הפסקה:
**שם הדובר:**.
- שמות הדוברים: לזהות מהתמלול (הצגה עצמית, פנייה בשם). אם שם דובר אינו ודאי -
להשתמש בתיאור עקבי (
**המנחה:**, **הרב X:**, **מהקהל:**).
- קריאות ביניים / שאלות מהקהל =
**מהקהל:**.
- במקרי ספק על מעבר דובר - להעדיף המשך הדובר הקודם (לא לקטוע באמצע רעיון).
פסוקים ומקורות (כשרלוונטי)
- פסוק תנ"כי שמצוטט → לשחזר לנוסח המדויק (התמלול האוטומטי מסלף), בניקוד מלא,
עם מקור בסוגריים:
"לֹא תַעֲמֹד עַל דַּם רֵעֶךָ" (ויקרא יט,טז).
שם הוי"ה בתוך ציטוט נכתב ה'. אם יש ספק בניקוד - לוודא, לא לנקד "בערך".
- ציטוטי חז"ל / ראשונים / אישים שאינם ודאיים-מילוליים → לצטט בלשון מכובדת
כפרפראזה, לא במרכאות מדויקות.
- שמות אישים/מקומות שהמכונה שיבשה → לתקן רק כשהזיהוי ודאי מההקשר. כשאינו ודאי -
לשמור קירוב פונטי קרוב, לא להמציא שם אחר, ולסמן לעצמך לדיווח בסוף.
פלט Markdown - מבנה
קובץ .md בעברית:
# כותרת ראשית תיאורית, תואמת לתוכן ולדוברים (תהפוך לשם הקובץ).
## כותרת נושא לכל קטע (חלוקה לפי נושא; התוכן עצמו נשאר כלשונו).
- פסקאות, כל מעבר דובר נפתח ב-
**שם:**.
- פסוקים מלאים בתוך
> (blockquote) - מנוקד + מקור, או בתוך השורה במרכאות אם קצר.
- מקפים: מקף קצר
- בלבד; אסור —/–.
תהליך עבודה (Workflow)
- חילוץ הקלט. התיקייה / הקובץ מכילים את התמלול (DOCX / TXT / SRT / VTT).
python "<SKILL_DIR>/scripts/extract_transcript.py"
(ללא ארגומנט - בוחר את ה-*.docx היחיד בתיקייה. אפשר להעביר נתיב מפורש.)
מפיק _raw_content.txt - פסקה נקייה לכל שורה עם אינדקס (000| ...), בלי חותמות זמן.
מדפיס מספר פסקאות והערכת מילים.
- קריאה מלאה. לקרוא את כל
_raw_content.txt עד הסוף לפני שמתחילים לערוך
(שיחה = לרוב אלפי מילים). תוך כדי - לזהות את הדוברים ואת מעברי הדובר.
- עריכה. לכתוב את המסמך הערוך המלא ל-
.md לפי ההוראות לעיל. שם הקובץ = ה-H1
בעברית (IRON RULE לשמות תיאוריים), ליד קובץ המקור. בשל ההיקף - הכתיבה עשויה
להתפרס על כמה הודעות; להמשיך עם append/Edit מהמקום שעצרת, בלי לדלג על נושא.
- בניית DOCX (סקריפט RTL עברי מוטמע בסקיל עצמו):
python "<SKILL_DIR>/scripts/build_docx.py" "<path-to-md>"
מפיק .docx באותו שם ותיקייה - RTL מלא, David, שחור-לבן, A4, מספרי עמודים.
הסקריפט עצמאי לגמרי - hebrew_docx_template.py יושב לידו באותה תיקיית scripts/.
- ניקוי. למחוק את
_raw_content.txt הזמני.
- הדפסה - רק אם המשתמש ביקש:
powershell -File "<SKILL_DIR>/scripts/print_docx.ps1" -DocxPath "<path-to-docx>"
אם ההיקף חורג מהודעה אחת
שיחה ארוכה עלולה לחרוג מכתיבה אחת. ממשיכים בהודעה נוספת בדיוק מהמקום שעצרת
(Edit/append ל-.md הקיים), בלי לדלג על נושא ובלי לקצר.
אימות לפני סיום
- סריקה משווה: כל נושא/סיפור/בדיחה מהמקור מופיע בתוצר (אורך התוצר ≈ אורך המקור).
- אפס חותמות זמן שנותרו:
grep -E '\b[0-9]{1,2}:[0-9]{2}\b' <md> מחזיר ריק.
- כל מעבר דובר מתויג.
- כל פסוק מנוקד + מקור מדויק; ציטוטים לא-ודאיים כפרפראזה.
- ה-DOCX נוצר (גודל > 0) ונפתח תקין.
- שמירת ה-
.md ליד ה-.docx (אותו שם) לעריכה עתידית.
- דיווח שקיפות בסוף: לציין למשתמש קטעים שהאודיו/התמלול בהם היה משובש מעבר
לשחזור (נשמרו כלשונם), ושמות פרטיים שלא אומתו בוודאות (קירוב פונטי).
1---2name: coherent-transcript-editor3description: Faithful, coherent editing of a raw spoken-transcript (auto-transcribed, timestamps/fillers/errors) into a clean readable document - WITHOUT summarizing, paraphrasing, or unifying speakers into one voice. "Every word verbatim" editing for DIALOGUE / PANEL / INTERVIEW / DEBATE / Q&A: keep every word, idea, story and aside of EVERY speaker in their own first person; only fix punctuation, paragraphing and transcription garble, remove timestamps/stutters, add bold speaker labels + topic headings, restore quoted verses to exact text + source, then build an RTL Hebrew DOCX. TRIGGER on Hebrew: 'עריכה קוהרנטית', 'ערוך תמלול דו-שיח', 'ערוך תמלול ראיון', 'ערוך תמלול פאנל', 'כל מילה ככתבה וכלשונה'. English: 'coherent edit of transcript', 'faithful transcript editing', 'edit this dialogue/interview transcript'. USE for a multi-speaker (or faithful single-speaker) transcript that must stay VERBATIM. NOT for a talk rewritten in first person, NOT for summaries.4---56# Coherent Transcript Editor - עריכה קוהרנטית נאמנה78`<SKILL_DIR>` = התיקייה שמכילה את קובץ ה-SKILL.md הזה (בדרך כלל9`~/.claude/skills/coherent-transcript-editor`). לפתור לנתיב מוחלט פעם אחת לפני10הרצת פקודות - PowerShell/cmd לא מרחיבים `~` בתוך מרכאות.1112מטרה: להפוך תמלול גולמי של שיחה / דו-שיח / פאנל / ראיון / דיון (לרוב תמלול אוטומטי13עם חותמות זמן, מילות מילוי ושיבושי תמלול) למסמך עברי **קריא וזורם** - תוך14**שמירה נאמנה על כל מילה** של כל דובר ("ככתבה וכלשונה").1516## עיקרון יסוד: עריכה קוהרנטית, לא סיכום ולא כתיבה מחדש1718זו **עריכה קוהרנטית בלבד**. לא סיכום, לא קיצור, לא פרפראזה, לא ארגון-מחדש כמסה,19ולא איחוד הדוברים לקול אחד. ההיקף של התוצר ≈ היקף המקור.2021**מותר ורצוי:**22- להסיר חותמות זמן (`0:06`, `1 דקה, 4 שניות`), גמגומים, וכפילויות-מילוליות23- לתקן פיסוק, לחלק לפסקאות24- לתקן שיבושי תמלול: מילים משובשות, שמות, ציטוטים שהמכונה סילפה25- לסמן מי מדבר (תוויות דובר מודגשות) ולהוסיף כותרות נושא קלות (H2)2627**אסור:**28- להשמיט נושא, רעיון, סיפור, בדיחה או הערת-אגב29- לקצר או "לדלג על החלק הפחות חשוב"30- לנסח מחדש משפט באופן שמשנה משמעות או טון31- לשנות עמדה של דובר, או לאחד שני דוברים לקול אחד32- **לכתוב בגוף ראשון אחיד** - כל דובר נשאר בגוף ראשון שלו (זו ההבחנה מ-`shiur-editor`)3334## הבחנה מ-shiur-editor (חשוב)3536| | `coherent-transcript-editor` (זה) | `shiur-editor` |37|---|---|---|38| קלט | דו-שיח / פאנל / ראיון / דיון, או דובר-יחיד שצריך נאמנות מילולית | דרשה / שיעור של דובר יחיד |39| גוף | גוף ראשון של **כל דובר בנפרד**, עם תוויות דובר | גוף ראשון **אחיד** (כאילו המשתמש מעביר) |40| מבנה | פסקאות נאמנות + כותרות נושא; **בלי** ארגון-מחדש | היררכיה לוגית מאורגנת מחדש |41| נאמנות | "כלשונה" - כל מילה, כל אסיד, כל בדיחה | שמירת כל הנושאים, אך מנוסח מחדש בחופשיות |4243אם המשתמש מבקש דרשה של דובר-יחיד מאורגנת ומנוסחת מחדש - השתמש ב-`shiur-editor`.4445## תוויות דובר (Speaker labels)4647לתמלול אוטומטי אין סימוני דובר - יש להסיק את המעברים מההקשר:48- מי פותח / מנחה / מציג את עצמו, מי שואל ומי עונה, מטבעות-לשון אישיים, "אני אספר", "תשמע".49- כל מעבר דובר נפתח בתווית מודגשת בתחילת הפסקה: `**שם הדובר:**`.50- שמות הדוברים: לזהות מהתמלול (הצגה עצמית, פנייה בשם). אם שם דובר אינו ודאי -51 להשתמש בתיאור עקבי (`**המנחה:**`, `**הרב X:**`, `**מהקהל:**`).52- קריאות ביניים / שאלות מהקהל = `**מהקהל:**`.53- במקרי ספק על מעבר דובר - להעדיף המשך הדובר הקודם (לא לקטוע באמצע רעיון).5455## פסוקים ומקורות (כשרלוונטי)5657- פסוק תנ"כי שמצוטט → לשחזר לנוסח המדויק (התמלול האוטומטי מסלף), בניקוד מלא,58 עם מקור בסוגריים: `"לֹא תַעֲמֹד עַל דַּם רֵעֶךָ" (ויקרא יט,טז)`.59 שם הוי"ה בתוך ציטוט נכתב `ה'`. אם יש ספק בניקוד - לוודא, לא לנקד "בערך".60- ציטוטי חז"ל / ראשונים / אישים שאינם ודאיים-מילוליים → לצטט בלשון מכובדת61 כפרפראזה, **לא** במרכאות מדויקות.62- שמות אישים/מקומות שהמכונה שיבשה → לתקן רק כשהזיהוי ודאי מההקשר. כשאינו ודאי -63 לשמור קירוב פונטי קרוב, **לא להמציא** שם אחר, ולסמן לעצמך לדיווח בסוף.6465## פלט Markdown - מבנה6667קובץ `.md` בעברית:68- `# כותרת ראשית` תיאורית, תואמת לתוכן ולדוברים (תהפוך לשם הקובץ).69- `## כותרת נושא` לכל קטע (חלוקה לפי נושא; התוכן עצמו נשאר כלשונו).70- פסקאות, כל מעבר דובר נפתח ב-`**שם:**`.71- פסוקים מלאים בתוך `> ` (blockquote) - מנוקד + מקור, או בתוך השורה במרכאות אם קצר.72- מקפים: מקף קצר `-` בלבד; אסור `—`/`–`.7374## תהליך עבודה (Workflow)75761. **חילוץ הקלט.** התיקייה / הקובץ מכילים את התמלול (DOCX / TXT / SRT / VTT).77 ```bash78 python "<SKILL_DIR>/scripts/extract_transcript.py"79 ```80 (ללא ארגומנט - בוחר את ה-`*.docx` היחיד בתיקייה. אפשר להעביר נתיב מפורש.)81 מפיק `_raw_content.txt` - פסקה נקייה לכל שורה עם אינדקס (`000| ...`), בלי חותמות זמן.82 מדפיס מספר פסקאות והערכת מילים.832. **קריאה מלאה.** לקרוא את **כל** `_raw_content.txt` עד הסוף לפני שמתחילים לערוך84 (שיחה = לרוב אלפי מילים). תוך כדי - לזהות את הדוברים ואת מעברי הדובר.853. **עריכה.** לכתוב את המסמך הערוך המלא ל-`.md` לפי ההוראות לעיל. שם הקובץ = ה-H186 בעברית (IRON RULE לשמות תיאוריים), ליד קובץ המקור. בשל ההיקף - הכתיבה עשויה87 להתפרס על כמה הודעות; להמשיך עם append/Edit מהמקום שעצרת, בלי לדלג על נושא.884. **בניית DOCX** (סקריפט RTL עברי מוטמע בסקיל עצמו):89 ```bash90 python "<SKILL_DIR>/scripts/build_docx.py" "<path-to-md>"91 ```92 מפיק `.docx` באותו שם ותיקייה - RTL מלא, David, שחור-לבן, A4, מספרי עמודים.93 הסקריפט עצמאי לגמרי - `hebrew_docx_template.py` יושב לידו באותה תיקיית `scripts/`.945. **ניקוי.** למחוק את `_raw_content.txt` הזמני.956. **הדפסה** - רק אם המשתמש ביקש:96 ```powershell97 powershell -File "<SKILL_DIR>/scripts/print_docx.ps1" -DocxPath "<path-to-docx>"98 ```99100## אם ההיקף חורג מהודעה אחת101102שיחה ארוכה עלולה לחרוג מכתיבה אחת. ממשיכים בהודעה נוספת בדיוק מהמקום שעצרת103(Edit/append ל-`.md` הקיים), בלי לדלג על נושא ובלי לקצר.104105## אימות לפני סיום106107- סריקה משווה: כל נושא/סיפור/בדיחה מהמקור מופיע בתוצר (אורך התוצר ≈ אורך המקור).108- אפס חותמות זמן שנותרו: `grep -E '\b[0-9]{1,2}:[0-9]{2}\b' <md>` מחזיר ריק.109- כל מעבר דובר מתויג.110- כל פסוק מנוקד + מקור מדויק; ציטוטים לא-ודאיים כפרפראזה.111- ה-DOCX נוצר (גודל > 0) ונפתח תקין.112- שמירת ה-`.md` ליד ה-`.docx` (אותו שם) לעריכה עתידית.113- **דיווח שקיפות בסוף:** לציין למשתמש קטעים שהאודיו/התמלול בהם היה משובש מעבר114 לשחזור (נשמרו כלשונם), ושמות פרטיים שלא אומתו בוודאות (קירוב פונטי).