Azure AI Transcription SDK for Python
用于 Azure AI 转录(语音转文字)的客户端库,支持实时和批量转录。
安装
pip install azure-ai-transcription
环境变量
TRANSCRIPTION_ENDPOINT=https://<resource>.cognitiveservices.azure.com
TRANSCRIPTION_KEY=<your-key>
身份验证
使用订阅密钥身份验证(此客户端不支持 DefaultAzureCredential):
import os
from azure.ai.transcription import TranscriptionClient
client = TranscriptionClient(
endpoint=os.environ["TRANSCRIPTION_ENDPOINT"],
credential=os.environ["TRANSCRIPTION_KEY"]
)
批量转录
job = client.begin_transcription(
name="meeting-transcription",
locale="en-US",
content_urls=["https://<storage>/audio.wav"],
diarization_enabled=True
)
result = job.result()
print(result.status)
实时转录
stream = client.begin_stream_transcription(locale="en-US")
stream.send_audio_file("audio.wav")
for event in stream:
print(event.text)
最佳实践
- 启用说话人分离:当存在多个说话人时启用
- 使用批量转录:处理存储在 Blob 存储中的长音频文件
- 捕获时间戳:用于生成字幕
- 指定语言:提高识别准确率
- 处理流式背压:实时转录时注意处理
- 关闭转录会话:完成后及时关闭
适用场景
本技能适用于执行概述中描述的工作流或操作。
限制
- 仅在任务明确符合上述描述范围时使用本技能。
- 不要将输出视为环境特定验证、测试或专家审查的替代品。
- 如果缺少必需的输入、权限、安全边界或成功标准,请停止并请求澄清。