搜索 VisionStory 开发者文档

没有找到匹配的文档“”。

可以尝试功能或资源名称,例如

VisionStory开发者

指南

语音转文字与对齐 API

使用 VisionStory API 将 WAV 或 MP3 语音转写为文本,获取词级时间戳、说话人标签和 SRT 字幕,或将已知脚本与音频对齐。

本页内容

VisionStory 语音转文字 API 可将语音音频转换为文本、字幕和精确的词级时间戳。需要识别语音内容、区分说话人或生成 SRT 时,使用转写接口;已经有准确脚本、只需要每个词的时间戳时,使用对齐接口。从图片、音频或视频中提取结构化内容,请使用媒体理解

两个接口均同步返回结果,接受不超过 15 MB 的 WAV 或 MP3 音频。每 5 分钟收费 1 点,不足 5 分钟按 5 分钟计算,仅处理成功时收费。需要有效的 Pro 或更高等级订阅,无需额外申请 Beta 白名单。

音频转写与对齐接口

方法路径适用场景
POST/api/v1/audio/transcribe语音转文字,可选说话人分离和 SRT 字幕
POST/api/v1/audio/align已知准确脚本时,获取词级时间戳

每次请求都必须在 audio 中选择且仅选择一种音频来源:可复用的 asset_id、可公开访问的 url,或包含 Base64 数据的 inline_data

将音频转写为文本

设置 diarize: true 可标记不同说话人的发言,设置 srt: true 可返回可直接保存的字幕内容。两者独立:使用 srt: true 不需要同时开启 diarize: true;只有明确请求说话人分离时,响应才包含说话人标签。

Shell
curl -s -X POST \
  -H "X-API-Key: $VISIONSTORY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":{"url":"https://example.com/interview.mp3"},"diarize":true,"srt":true}' \
  https://openapi.visionstory.ai/api/v1/audio/transcribe

响应包含完整转写文本、识别出的语言、词级时间戳、可选的 speaker 标签、可选 SRT、音频时长和消耗的点数:

JSON
{
  "data": {
    "text": "Welcome to VisionStory.",
    "language": "en",
    "words": [
      { "text": "Welcome", "start_sec": 0.0, "end_sec": 0.48, "speaker": "speaker_0" }
    ],
    "srt": "1\n00:00:00,000 --> 00:00:01,200\nWelcome to VisionStory.",
    "duration_sec": 1.2,
    "cost_credit": 1
  }
}

使用 Python SDK:

Python
from pathlib import Path
from visionstory import VisionStoryClient

client = VisionStoryClient.from_env()
transcript = client.transcribe_audio(
    audio_file=Path("interview.mp3"),
    diarize=True,
    srt=True,
)
Path("interview.srt").write_text(transcript["srt"], encoding="utf-8")

将脚本与音频对齐

对齐适用于文本转语音、配音或旁白制作之后。请提交与音频中实际说出的内容完全一致的文本:

Shell
curl -s -X POST \
  -H "X-API-Key: $VISIONSTORY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":{"asset_id":"YOUR_AUDIO_ASSET_ID"},"text":"Welcome to VisionStory."}' \
  https://openapi.visionstory.ai/api/v1/audio/align

响应返回 wordsduration_seccost_credit。每个词包含 textstart_secend_sec

使用 CLI 或 MCP

Shell
visionstory transcribe --audio-file interview.mp3 --diarize --srt --output interview.srt
visionstory align --audio-url https://example.com/speech.mp3 --text "Welcome to VisionStory."

MCP 通过 transcribe_audioalign_audio 提供相同能力。本地 stdio MCP 支持文件路径、URL 或素材 ID;远程 MCP 无法读取你电脑上的文件,因此仅支持可公开访问的 URL 或可复用的素材 ID。

限制与计费

  • 音频输入:WAV 或 MP3,文件不超过 15 MB。
  • 处理方式:同步返回;尽量使用较短音频,避免客户端或代理超时。
  • 计费:每 5 分钟 1 点,不足 5 分钟按 5 分钟计算,仅成功时收费。
  • 并发:超出每个 API Key 同步并发上限的请求会被拒绝,不会排队。
  • 复用:通过素材 API 上传经常使用的音频,再传入其 asset_id
  • 文本转语音 — 生成 MP3 语音,再对齐生成字幕。
  • 声音 — 筛选公共声音或克隆可复用的声音。
  • Python SDK — 在 Python 中调用转写与对齐。
  • API 参考 — 查看准确的请求和响应结构。