AI 在线说话人分离
上传一段对话、一场戏或一期播客,CosyVoice 自动分辨谁在什么时候说话,把每个声音聚类成独立角色,并提取成可命名、可复用的声线——无需写代码,无需 GPU。
分离在后台任务中进行:先分离人声、再转写、最后聚类说话人。10 分钟的文件通常需要几分钟——你可以先离开页面,稍后回来看结果。
在线说话人分离是怎么工作的
每次上传都会在云端跑完四个阶段。音频越长耗时越久——请预期几分钟而不是几秒,任务完成后结果会一直等你回来。
人声分离
先剥离背景音乐与音效,让模型听到干净的语音——提取出的声线参考也因此保持干净。
语音转写
语音识别按词级时间戳切分音频,每一句话都带着自己的文字稿。
声纹聚类
为每个片段计算声纹向量,声音相似的片段聚成同一个说话人——你不需要预先指定人数。
声线参考
为每个检测到的说话人,从最平稳的台词中拼出一段干净参考音——可命名、可描述、可克隆。
为什么选择在线说话人分离
无需代码与 GPU
pyannote 和 WhisperX 是优秀的开源分离库——如果你愿意折腾 Python、CUDA 和调参。在这里,说话人分离只是浏览器里的一次上传。
得到声音,而不只是标签
多数说话人分离工具止步于「Speaker 0:00:00–00:12」。CosyVoice 会同时提取每个说话人的真实声线,能试听、能复用。
给每个说话人命名与描述
把 Speaker 0、1、2 变成有名字、有声线描述的角色——你能搜索,CosyVoice Agent 为新作品选角时也能搜索。
为长音频而设计
访谈、剧集、围读会:任务在后台排队,按阶段汇报进度,结果保留到你回来查看。
拆出的角色声线能做什么
角色声线克隆
从你拥有权利的素材里提取每个角色,再用 CosyVoice 声音克隆为他们合成新台词。
播客与访谈整理
识别音频中的说话人,得到按人分组的文字稿和发言时长统计,而不是一整面没有署名的文字墙。
配音前处理
配音前先按说话人拆分音频,让场景里的每个声音在目标语言中保持自己的身份。
语音数据集
把多人录音整理成按说话人分类的语料,用于 TTS 研究、评测与微调。
说话人分离常见问题
什么是说话人分离(Speaker Diarization)?
说话人分离回答「谁在什么时候说话」:把一段音频切分并按说话人身份分组。CosyVoice 提供在线说话人分离——上传文件,就能得到带时间轴、文字稿和可复用声线参考的说话人列表。
怎么识别一段音频里的说话人?
上传文件并等待后台任务完成。每个检测到的说话人都会带有彩色时间轴、发言占比和代表台词,几秒钟就能认出并重命名他们。
可以把音频按说话人拆成独立的声音吗?
可以——这正是核心输出。每个说话人都会得到一段独立、干净的声线参考(由 TA 最好的片段拼装而成),可以存为音色库里可克隆的声音。
支持视频吗?比如从一场电影戏里提取人声?
支持。上传视频会自动提取音轨;在聚类说话人之前,人声分离会先移除音乐和音效。请只上传你拥有或获得授权的素材。
这和 pyannote、WhisperX 有什么区别?
它们是面向开发者的开源分离库。这里是托管管线:分离、转写、声纹聚类和声线提取都在云端完成,输出直接接入声音克隆和 CosyVoice Agent。
说话人分离需要多长时间?
它不是即时的。管线要分离人声、转写、再聚类声纹,10 分钟的文件通常需要几分钟。任务在队列中运行——关掉标签页也没关系,结果会等你回来。
最多能检测多少个说话人?
你不需要指定人数。聚类会从音频本身推断说话人数量,单个文件在 8 个以内的独立声音效果最佳。