查看 VisionStory 开发者工具和文档的最新功能与改进。当前版本:0.0.9。SDK、CLI、MCP 客户端和 AI Agent 可以读取机器可读版本清单,在使用过程中发现新能力和升级说明。
0.0.9 — 2026 年 9 月 5 日
结构化媒体理解与双语开发者文档
新增
- Python SDK、CLI、本地 MCP 和 Agent Skill 新增结构化媒体理解,支持从图片、音频和视频中提取信息。
- 文本转语音新增可选语速设置,支持 slow、normal 和 fast。
- 新增完整中文指南,代码和 Agent Prompt 保持英文原文。
变更
- 更新模型查询文档、双语导航、规范链接、语言链接和正式环境 Sitemap;流程插图改为独立 SVG 文件加载。
修复
- 补齐全部 27 个 API 成功响应示例,包括类型明确的图片与 AI 视频模型目录,以及二进制语音响应头。
0.0.8 — 2026 年 9 月 2 日
CLI 登录、支持语言地区的声音与完整 API 工具
新增
- 新增
visionstory login,安全地提示输入、验证并保存 API Key,供后续 CLI 会话使用。 - 新增
visionstory logout,移除 CLI 保存的凭证。 - 声音列表和克隆响应新增
locale元数据,SDK、CLI、MCP 工具和 Agent Skill 一致支持声音筛选与分页。 - 随附的 Agent Skill 辅助程序新增文本转语音、音频转写和逐词对齐命令。
变更
- CLI 首次设置简化为一条登录命令,并明确确认连接结果和剩余点数。脚本和 CI 仍可使用
VISIONSTORY_API_KEY,且它优先于已保存的凭证。 GET /api/v1/voices的筛选参数由language改为 BCP 47locale。基础语言标记(如es)匹配所有地区变体;es-MX、en-GB、zh-TW和zh-HK等完整标记只选择对应地区。- 从文档中的数字人视频请求和模型能力枚举中移除
480p;新接入应使用720p、1080p或2k。为兼容旧调用,API 仍接受旧版480p请求,并按720p渲染和计费;历史视频响应仍可能返回480p。
修复
- 修复 Agent Skill 的 MP3 二进制处理、远程 MCP 供应商筛选的大小写兼容,以及生成的 REST 示例中无效的 Python 布尔值。
- 明确音频转写支持独立设置
srt: true,不再要求同时设置diarize: true;只有请求说话人分离时,响应才包含说话人标签。
0.0.7 — 2026 年 9 月 2 日
音频理解、声音查询与更简单的 API 接入
新增
- 新增
POST /api/v1/audio/transcribe,支持语音转文字、词级时间戳、说话人分离和 SRT 字幕。 - 新增
POST /api/v1/audio/align,将已知脚本与音频逐词对齐。 - 新增声音筛选与分页、结构化声音属性、形象
default_voice_id、克隆声音元数据,以及 TTS 可选的locale支持。 - Python SDK、CLI、本地 MCP 和远程 MCP 同步增加对应操作。
变更
- 取消各项能力独立的 Beta 白名单,改为要求有效的 Pro 或更高等级订阅。
- 模型查询不再返回
vs_talk_v1。旧版vs_talk_*和480p视频请求会自动按vs_character_v4和720p渲染,并根据实际输出计费。 - 公共 API 操作数量从 24 个扩展到 26 个。
0.0.6 — 2026 年 8 月 27 日
API Key 管理与更清晰的 API 参考
新增
- 新增 API Key工作区,支持创建、重命名、复制和删除密钥,并可直接查看用量与计费。
变更
- 完善 API 参考,明确支持的模型、参数值、默认值、媒体要求,并提供可直接使用的请求示例。
修复
- 改善移动端 API Key 管理体验,修正文档中不完整或无效的示例。
0.0.4 — 2026 年 8 月 25 日
开发者平台测试版本
新增
- 发布 VisionStory 开发者门户,提供 API 参考、接入指南和代码示例。
变更
- 完善 SDK、CLI、MCP 和 Agent Skill 的认证说明与首次设置流程。
破坏性变更和弃用会在对应版本中明确说明。