AgentMarketMCP / SKILL 资产档案馆

目录 / 音视频转录

SKILL 未评级 已上架

音视频转录

音视频转文档全流程处理技能(支持视频与音频输入,也支持「一段音视频拆成多段文件」合并转录)。 三档模型选择(Step 2.5):① 快速 = SenseVoice-Small q8 量化(FunASR GGUF 运行时,纯 CPU ~33 倍实时、 零 Python/torch 依赖,模型仅 254MB;⚠️ 无模型内说话人分离,必接 Step 3.5C LLM 语义重切); ② 精准 = MOSS-Transcribe-Diarize 0.9B 端到端(转录+说话人+时间戳一次生成,分离最稳、标点自然; 首次需下载 ~1.8GB 模型 + torch 推理栈;Apple Silicon 另可选 MLX 后端加速); ③ 云端 = Qwen3-ASR-Flash(需 DashScope Key)。三档随时可切。 开始前用 `scripts/accelerator.py` 统一探测本机加速器并给出推荐档位(覆盖 NVIDIA CUDA / AMD ROCm / Apple MPS / Intel XPU / 纯 CPU;**不要只查 nvidia-smi**,否则 AMD 与 Mac 用户会被静默降级),用户三选一。 流程:检测输入类型(音频跳过转 MP3 且无需静帧)-> 模型按能力自动决定切段 -> 转录 -> 说话人分离 (精准档 MOSS 端到端一次生成、快速档 GGUF 走 LLM 语义重切、云端 LLM 语义切分,支持多说话人) -> LLM 生成摘要与人物信息 -> 生成带时间码的 Word 文档(.docx)-> 自检精简语气词 -> 交付前总校验 -> 预览确认 -> 可选分发到在线文档平台。 档位细节、平台参数、环境变量、失败处置全部在 references/ 按需读取,本文只留决策与执行要点。 若用户把一段音视频拆成多个文件,需请用户明确告知哪几个属于同一段,技能自动合并为一篇文档。 适用于任何支持 bash 命令执行和文件读写的 AI 编码代理(Agent);处理完毕主动询问交付位置。

模型生成摘要(rules/v1 · 2026-09-22 06:32):音视频转文档全流程处理技能(支持视频与音频输入,也支持「一段音视频拆成多段文件」合并转录)
这是模型对公开材料的总结,不是官方声明,请以原链内容为准。

存档时间线

版本存档时间内容哈希内容
v12026-09-22 06:30f103c0cf 可取

版本索引永久保留;内容副本只保留最近 2 版,更早版本仅留索引与哈希(存档时间线的证据链不会因此断裂)。

下载存档内容副本

纠错与举报(发现条目失效、署名有误或涉及侵权?)
提交举报 / 纠错

侵权举报经核验成立后,我们会即时下线该条目并删除已存的内容副本。