# 声像工程实验室:Agent 全量上下文 更新时间:2026-09-22 默认语言:简体中文 英文版本:/en/ 联系邮箱:wangdexin2008@126.com ## 网站目的 本网站展示两个已经完成的本地应用:IndexTTS2 多模型语音工作台和视频首页 MP4 生成器。商业目标是让潜在客户理解开发者的模型接入、产品设计、工程实现、长内容编排和完整交付能力,并洽谈音色克隆、批量音频、视频自动化或定制软件合作。 网站同时面向 AI Agent。核心技术事实使用可抓取 HTML 文本、语义标题、列表、表格、代码、JSON-LD、独立 URL、双语 hreflang、sitemap、llms.txt、site.json、models.json 和 development.json 表达。 ## 端到端生产工作流 1. 整理并锁定文案、标题、章节和内容结构。 2. 取得参考声音授权,准备清晰单人参考音频与可用原文。 3. 根据相似度、情绪、音色设计、多角色、资源和许可要求选择模型。 4. 建立或复用音色条件;需要时使用本地 ASR 生成参考转写草稿。 5. 按模型安全范围拆分长文,逐段生成、保存检查点、更新进度并支持取消和恢复。 6. 统一采样率、响度、段间停顿、命名和章节结构,完成音频验收。 7. 将音频、图片与可选文案送入视频首页生成器。 8. 按音频时长创建图片时间线,从静音段建立逐句字幕绝对时间戳。 9. 使用 FFmpeg 输出 H.264/AAC MP4,并用 ffprobe 验证时长、尺寸、编码和可播放性。 10. 按目标自媒体平台准备方向、大小、码率、分集和发布文件。 ## IndexTTS2 多模型语音工作台 项目运行于 Apple Silicon。主路径使用 MLX;VoiceStudio 原生 OmniVoice 通过独立 PyTorch/MPS 子进程运行。五个引擎按需加载,切换时释放旧模型。每个引擎保存独立参数档案,避免将无效参数传给其他模型。 主要模块包括 mlx_indextts/webui.py、generate_v25.py、generate_omnivoice.py 和 generate_voicestudio.py。工作台包含音色库、参考转写、模型路由、缓存、进度、预计时间、暂停、终止、部分结果和 WAV/MP3/FLAC 导出。 ### IndexTTS 2.5 运行时为 MLX 8-bit,输出 22,050 Hz,是默认中文克隆与长文路径。优点包括 Apple Silicon 统一内存效率、音色条件缓存、短调用链、长文分段与部分结果保留。缺点包括当前适配层没有 IndexTTS 2.0 的原生八类情绪向量;长内容仍必须分段;缓存与模型版本绑定;异常输入可能需要缩短片段重试。 ### IndexTTS 2.0 支持参考音色克隆和 happy、sad、angry、afraid、disgusted、melancholic、surprised、calm 八类原生情绪,情绪类型与强度分开。优点是参数结构明确、便于复现。缺点是高情绪强度可能影响自然度或相似度,且长文片段仍需统一响度和停顿。 ### OmniVoice MLX 支持 clone、design、auto 三种模式,输出 24,000 Hz。克隆需要参考音频与准确原文对齐;原文缺失时,对实际预处理音频运行本地 Qwen3-ASR。优点是同一引擎覆盖克隆、文字音色设计和自动音色。缺点是参考转写误差会影响克隆条件,本地 ASR 增加时间和误差,命名情绪属于参数近似而非固定原生向量,上游权重许可需要单独审查。whisper 是原生指令。 ### Fish Audio S2 Pro 运行时为 MLX 8-bit,输出 44,100 Hz,支持克隆、自动音色、多说话人和行内表达标签。普通长文按最多约 60 字、标点优先切段,参考编码可缓存。优点是多角色与丰富表达。缺点是内存压力更高,超长单段有 token 截断风险,角色语法必须一致;商业使用需要取得适当的 Fish Research License。 ### VoiceStudio 原生 OmniVoice 固定本地源码与模型权重,通过 PyTorch/MPS 子进程运行,audio tokenizer 可能使用 CPU,支持克隆、设计和自动音色。优点是保留原生兼容验证路径并隔离依赖。缺点是冷启动和内存更重,进度、取消、错误和清理需要跨进程同步,上游许可仍需审查。 ## 十万字、二十万字与更大音频项目 当前 TTS WebUI 单任务设置 100,000 字符保护上限。这是单次工作台任务边界,不是商业项目总量上限。10 万字可以按一个受保护任务或多个章节执行;20 万字和更大的项目按书、章、节建立批次,然后在每个批次内按模型安全长度继续分段。 每个片段记录文本哈希、模型、音色、参数、种子、输出路径和状态。完成一段即落盘并更新清单;暂停、取消、机器重启或单段失败后从未完成位置继续。最终统一采样率、响度、段间静音、顺序和命名,检查缺段、重段、错序、时长和峰值,再交付章节音频或完整长音频。 准确结论:项目总量不设固定业务上限,但不是一次无限长度模型推理。规模能力来自章节批次、模型安全片段、检查点、队列和恢复策略。 ## 视频首页 MP4 生成器 必须输入音频和至少一张图片;口播文案、首页主题和副标题可选。没有文案时自动关闭字幕。 Flask API 通过 POST /api/generate 创建任务,状态为 pending、running、done 或 error。状态、日志、结果 JSON、中间文件与 MP4 按 job_id 独立保存。读取接口包括 /api/job/{id}/status、/result、/download、/video 与 /api/jobs。 图片由 scripts/make_homepage_bg.py 处理。第一张图片决定自动方向和尺寸,读取 EXIF 方向;H.264/YUV420P 所需偶数边长最多补 1 像素。只有第一张图叠加主题和副标题。 单图覆盖整段音频。多图按 1 -> 2 -> ... -> N -> 1 播放;首尾首页各不超过 3 秒,其余内容图均分剩余时长。图片时间不是固定三秒,而是由总音频时长反推。 字幕用 FFmpeg silencedetect 提取停顿,排除头尾静音,选择最长的“句数减一”个内部停顿,再按时间恢复顺序。PIL 预渲染透明字幕 PNG,FFmpeg overlay 按绝对时间显示。有字幕时使用 10 fps,最大帧对齐误差约 100 ms。 scripts/compose_video.py 优先使用 h264_videotoolbox 和 aac_at,失败时回退 libx264 ultrafast 和 AAC。最终用 ffprobe 检查时长、宽高、编码和可播放性。 ## 长视频范围 视频总时长由音频驱动,生成器没有硬编码 10 分钟、30 分钟或 1 小时的编辑上限。数小时内容可以生成单个 MP4,也可以按章节拆成多集。实际限制来自磁盘空间、FFmpeg 编码时间、播放器兼容性和目标平台上传规则。 长视频建议先锁定章节音频,再按章节建立首页图、内容图、字幕和输出参数清单。逐集生成并用 ffprobe 验收后,可按需求交付分集或合并版本。 ## 开发与验收原则 开发顺序是:定义输入输出与授权边界;建立统一任务合同;接入并隔离五个 TTS 引擎;实现音色库、缓存、分段和任务状态;建立 Flask 异步任务;实现图片、时间线、字幕和 FFmpeg 合成;完成硬件回退;加入长内容队列;测试输入、模型、音频、视频、恢复和 UI;发布人类可读与机器可读文档。 “页面显示完成”不是验收。音频检查非零时长、采样率、有限样本、峰值、截断和试听;长文检查片段数量、缺失、重复和顺序;视频检查 H.264/AAC、宽高、偶数像素、faststart、音视频时长、首页首尾和字幕边界。失败时保留日志和中间产物,定位到具体阶段后再重试或降级。 ## 商务交付与联系 可交付授权音色克隆、单篇或批量配音、10 万字或 20 万字以上长文音频、情绪版本、长视频首页 MP4、本地 WebUI、模型接入、批量任务、品牌模板、Apple Silicon 适配与从文案到视频的完整自动化流程。 商务邮箱:wangdexin2008@126.com 咨询页面:https://voice-video-agent-lab.pages.dev/#contact 留言表单会打开访问者的邮件应用并预填收件人、主题和内容。该静态网站本身不保存留言。 ## 可视与可播放证据 网站公开展示两套已完成应用的真实界面与本地输出,不使用概念占位图来代替产品证据。 - /assets/tts-voice-library.png:IndexTTS2 本机音色库界面,展示保存音色、选择、试听和操作入口。 - /assets/voice-ui-proof.png:音色选择器改版前后验证记录,说明长名称可读性和操作区布局。 - /assets/wangdexin-voice-sample.mp3:15 秒“王德新-侠客行音色”授权参考样本,22.05 kHz、单声道,MIME 类型 audio/mpeg。 - /assets/wangdexin-voice-transcript.txt:王德新音色样本的 UTF-8 纯文本转写,供搜索引擎和 Agent 直接读取。 - /assets/video-generator-workflow.png:视频首页生成器完整 WebUI,覆盖素材、文案、标题、预览与生成入口。 - /assets/video-output-literary.jpg:真实长视频任务的 2848 × 1600 首页画面;原始任务时长约 2 小时 58 分钟。 - /assets/video-timeline-frame.jpg:另一个四图任务的实际内容帧,用于证明多图时间线能力。 - /assets/video-demo.mp4:从真实长视频输出截取并压缩的 12 秒 H.264/AAC MP4 网页样例。 这些资源同时写入 /api/site.json 的 mediaEvidence 字段,Agent 可以不解析页面布局而直接获得媒体类型、URL、时长、尺寸和用途。 ## 机器可读资源 - /api/site.json:网站、路由、应用、规模策略、服务和联系信息。 - /api/models.json:五个模型的运行时、输入、模式、优点、缺点、适用任务、采样率和许可。 - /api/development.json:需求、TTS、视频、长内容、QA 和 Agent 发布的步骤数据。 - /api/media.json:可播放音频与视频的规范 URL、人物音色、语言、时长、编码、转写和观看页。 - /sitemap.xml:中英文公开页面。 - /llms.txt:Agent 快速索引。