# Transcribe

> Транскрибирование видео и аудио файлов через Gemini API. Используй когда пользователь просит транскрибировать, расшифровать запись, сделать конспект встречи, извлечь речь из видео или аудио, преобразовать речь в текст. Поддерживает mp4, mkv, webm, avi, mov, mp3, wav, ogg, m4a, flac.

- Skill: `whiner9/transcribe` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add whiner9/transcribe`
- Raw SKILL.md: https://api.skillmd.com/api/skills/whiner9/transcribe/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Integrations & APIs
- Author: whiner9 (https://skillmd.com/u/whiner9)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/whiner9/transcribe

---


# /transcribe - Транскрибация видео и аудио

Транскрибирует аудио и видео файлы через Gemini 2.5 Flash API.

## Режимы

### Generic (по умолчанию)
Дословная транскрипция речи с таймкодами [MM:SS] и идентификацией спикеров.

Выходные файлы:
- `<имя> - транскрипция.md` - дословная речь с таймкодами
- `<имя> - саммари.md` - краткое саммари (с флагом `--with-summary`)

### Анализ интерфейсов (`--analyze-ui`, только видео)
Детальный анализ видеозаписи с разбором экранного интерфейса, навигации, действий + скриншоты.

Выходные файлы:
- `<имя> - саммари.md` - краткий обзор (тема, участники, решения)
- `<имя> - детальный.md` - пошаговый хронологический анализ с содержимым экрана, скриншотами
- `<имя> - транскрипция.md` - дословная речь с таймкодами
- `screenshots/` - PNG-кадры ключевых моментов

## Использование

```
/transcribe <FilePath> [--output-dir DIR] [--analyze-ui] [--with-summary] [--format md|txt]
```

| Параметр | Обязательный | По умолчанию | Описание |
|----------|:------------:|--------------|----------|
| FilePath | да | - | Путь к аудио/видеофайлу |
| --output-dir | нет | `<каталог_файла>/Транскрипция/<имя>/` | Каталог для результатов |
| --analyze-ui | нет | выкл | Режим анализа интерфейсов (только видео) |
| --with-summary | нет | выкл | Добавить саммари (для generic-режима) |
| --format | нет | md | Формат вывода: md или txt |

## Поддерживаемые форматы

- **Видео:** mp4, mkv, webm, avi, mov
- **Аудио:** mp3, wav, ogg, m4a, flac, aac, wma

## Зависимости

- Python-пакеты: `google-genai`, `python-dotenv`
- Системные: `ffmpeg`, `ffprobe` в PATH
- API-ключ: файл `~/.claude/skills/transcribe/.env` с `GEMINI_API_KEY=...`

## Инструкция

1. Определи `FilePath` и опциональные флаги из аргументов пользователя.

2. Запусти скрипт:

```bash
PYTHONUNBUFFERED=1 python ~/.claude/skills/transcribe/scripts/transcribe.py "<FilePath>" [--output-dir "<OutputDir>"] [--analyze-ui] [--with-summary] [--format md|txt]
```

**ВАЖНО:** `PYTHONUNBUFFERED=1` обязательно, иначе stdout буферизируется и прогресс не отображается.

3. Скрипт выполняется долго (5-15 мин в зависимости от длины записи). Файлы > 1 часа автоматически разбиваются на части.

4. После завершения сообщи пользователю пути к результатам.

5. Прочитай саммари (если есть) или начало транскрипции и покажи пользователю.

## Стоимость

~$0.10 за 1 час записи (Gemini 2.5 Flash). Длинные файлы стоят пропорционально.

## Ограничения

- Максимум ~1 час за один запрос Gemini (скрипт разбивает автоматически)
- Кириллические имена файлов: скрипт автоматически копирует во temp с ASCII-именем
- Качество скриншотов зависит от качества исходного видео
- Точность таймкодов +/- несколько секунд
- `--analyze-ui` с аудиофайлом автоматически переключается на generic + саммари

