VisionStory 语音转文字 API 可将语音音频转换为文本、字幕和精确的词级时间戳。需要识别语音内容、区分说话人或生成 SRT 时,使用转写接口;已经有准确脚本、只需要每个词的时间戳时,使用对齐接口。从图片、音频或视频中提取结构化内容,请使用媒体理解。
两个接口均同步返回结果,接受不超过 15 MB 的 WAV 或 MP3 音频。每 5 分钟收费 1 点,不足 5 分钟按 5 分钟计算,仅处理成功时收费。需要有效的 Pro 或更高等级订阅,无需额外申请 Beta 白名单。
音频转写与对齐接口
| 方法 | 路径 | 适用场景 |
|---|---|---|
POST | /api/v1/audio/transcribe | 语音转文字,可选说话人分离和 SRT 字幕 |
POST | /api/v1/audio/align | 已知准确脚本时,获取词级时间戳 |
每次请求都必须在 audio 中选择且仅选择一种音频来源:可复用的 asset_id、可公开访问的 url,或包含 Base64 数据的 inline_data。
将音频转写为文本
设置 diarize: true 可标记不同说话人的发言,设置 srt: true 可返回可直接保存的字幕内容。两者独立:使用 srt: true 不需要同时开启 diarize: true;只有明确请求说话人分离时,响应才包含说话人标签。
curl -s -X POST \
-H "X-API-Key: $VISIONSTORY_API_KEY" \
-H "Content-Type: application/json" \
-d '{"audio":{"url":"https://example.com/interview.mp3"},"diarize":true,"srt":true}' \
https://openapi.visionstory.ai/api/v1/audio/transcribe
响应包含完整转写文本、识别出的语言、词级时间戳、可选的 speaker 标签、可选 SRT、音频时长和消耗的点数:
{
"data": {
"text": "Welcome to VisionStory.",
"language": "en",
"words": [
{ "text": "Welcome", "start_sec": 0.0, "end_sec": 0.48, "speaker": "speaker_0" }
],
"srt": "1\n00:00:00,000 --> 00:00:01,200\nWelcome to VisionStory.",
"duration_sec": 1.2,
"cost_credit": 1
}
}
使用 Python SDK:
from pathlib import Path
from visionstory import VisionStoryClient
client = VisionStoryClient.from_env()
transcript = client.transcribe_audio(
audio_file=Path("interview.mp3"),
diarize=True,
srt=True,
)
Path("interview.srt").write_text(transcript["srt"], encoding="utf-8")
将脚本与音频对齐
对齐适用于文本转语音、配音或旁白制作之后。请提交与音频中实际说出的内容完全一致的文本:
curl -s -X POST \
-H "X-API-Key: $VISIONSTORY_API_KEY" \
-H "Content-Type: application/json" \
-d '{"audio":{"asset_id":"YOUR_AUDIO_ASSET_ID"},"text":"Welcome to VisionStory."}' \
https://openapi.visionstory.ai/api/v1/audio/align
响应返回 words、duration_sec 和 cost_credit。每个词包含 text、start_sec 和 end_sec。
使用 CLI 或 MCP
visionstory transcribe --audio-file interview.mp3 --diarize --srt --output interview.srt
visionstory align --audio-url https://example.com/speech.mp3 --text "Welcome to VisionStory."
MCP 通过 transcribe_audio 和 align_audio 提供相同能力。本地 stdio MCP 支持文件路径、URL 或素材 ID;远程 MCP 无法读取你电脑上的文件,因此仅支持可公开访问的 URL 或可复用的素材 ID。
限制与计费
- 音频输入:WAV 或 MP3,文件不超过 15 MB。
- 处理方式:同步返回;尽量使用较短音频,避免客户端或代理超时。
- 计费:每 5 分钟 1 点,不足 5 分钟按 5 分钟计算,仅成功时收费。
- 并发:超出每个 API Key 同步并发上限的请求会被拒绝,不会排队。
- 复用:通过素材 API 上传经常使用的音频,再传入其
asset_id。
相关 VisionStory API 指南
- 文本转语音 — 生成 MP3 语音,再对齐生成字幕。
- 声音 — 筛选公共声音或克隆可复用的声音。
- Python SDK — 在 Python 中调用转写与对齐。
- API 参考 — 查看准确的请求和响应结构。