🎙️ 多模态生成 & 语音 & TTS 每日简报

2026年7月8日(周三) | 覆盖:X / Reddit / GitHub / 学术论文 / 行业新闻


一、🔥 头部企业动态

1. xAI 发布 21 个多语言 Grok Voice 新声音 重磅

xAI(Elon Musk)于 7 月 6 日发布 21 个全新旗舰 AI 声音,支持 25+ 种语言(含中、英、日、韩、印地语等),每个声音针对不同场景定制。同时推出 Voice Agent Builder 无代码平台,定价 $0.05/分钟,支持 1 分钟音频克隆声音,延迟低于 1 秒。xAI 声称在 Big Bench Audio 基准排名第一。

2. OpenAI 被曝测试双向语音模型 GPT-Bidi-1 独家

6 月 17 日泄露消息:OpenAI 测试代号 GPT-Bidi-1 的下一代双向音频模型。核心突破是"边说边听"——AI 可在说话的同时接收用户打断、修正和插话,无需等待话轮结束。提供高/中/即时三档智能速度选择,与现有 Advanced Voice Mode 共存。

3. Google Gemini 3.1 Flash Audio 正式上线

DeepMind 发布 Gemini 3.1 Flash Audio,包括实时语音交互(Flash Live)和 TTS 两个子模型。支持 70+ 语言,128K token 多模态输入,所有输出嵌入 SynthID 水印。TTS 在 Artificial Analysis 排行榜 Elo 评分达 1,211。Gemini Omni Flash 支持 10 秒同步音视频生成。

4. ElevenLabs AI 迈克尔·凯恩有声书引发行业争议

用授权 AI 声音制作《奥德赛》有声书(13 小时,20 个 AI 角色,AI 配乐),仅用 6 周。APA 6 月调查:仅 16% 有声书听众听过 AI 配音作品。7 月 9 日将下线 scribe_v1 等三个旧模型。

5. 韩国 NC AI 的 VARCO Voice 获联合国 AI 奖

在 ITU"AI for Good Global Summit 2026"获奖。"My AAC"辅助沟通应用为言语障碍人士提供个性化 AI 声音,8 个 AI 模型列入官方出版物。

二、🚀 开源与技术突破

1. 小红书开源 dots.tts 开源

2B 参数,全连续端到端自回归架构(无离散 token),Apache 2.0。中文 WER 0.94%,英文 WER 1.30%,24 语言平均相似度 83.9%

2. ZONOS2 8B — 600 万小时语音 MoE 模型

8B 参数(900M 激活),MoE 架构,600 万+小时训练,Apache 2.0。自然度和声音克隆保真度 SOTA,支持流式推理。

3. ViiTorVoice-NAR — 首个词级音频编辑 TTS 新功能

7 月 1 日发布,独特能力:在已完成录音中替换单个词语无需重新生成整句。60ms 首帧延迟,英文 WER 1.32%。

4. vLLM-Omni v0.24.0 发布

新增 Qwen3-TTS、MOSS-TTS、CosyVoice、Fish Speech 等多款 TTS,SSE 流式输出 + 词级时间戳。

5. Hugging Face + Cerebras 实时语音管道

Parakeet → Gemma 4 VLM → Qwen3TTS 级联管道,消除多秒延迟,已驱动 9,000+ Reachy Mini 机器人

三、📚 学术前沿(7 篇)

论文亮点
Audex (NVIDIA)30B MoE 统一音频-文本 LLM,同时理解+生成,保留文本推理能力 arXiv
UniSonate (ACL 2026)统一 TTS+音乐+音效生成,指令式 TTS 的 WER 1.47% ACL
ImmersiveTTS (ACL 2026)环境感知 TTS,多模态扩散 Transformer ACL
DELTA-TTS (ICML WS)AR→扩散 LLM 转换,提速 3.3 倍,WER 1.75%,减少幻觉 arXiv
GRAFT逐词发音控制,5 语言音素错误率降低 22-39% arXiv
WordVoice五维词级控制(时长/边界/能量/音高/语调),4700h 双语数据 arXiv
vLLM Audio Pipeline统一语音理解生成推理,CFG 吞吐达无 CFG 的 80% arXiv

四、⚖️ 行业监管与社会影响

1. 中国"AI 偷声"危机升级 监管

配音演员收入最高下降 80%,声音被电商平台以 ¥1.98 元 克隆售卖。"AI 声音人格权侵权第一案"判赔 25 万元,但鉴定费高达数万元。

2. 网信办"清朗·AI 应用整治"专项行动

处置 14,000+ 违规网站/App/AI 智能体,删除 600 万+条违规内容,下架 1,300+ 不合规 AI 产品及 9 个非法开源数据集。

3. EU AI Act 第 50 条 · 8 月 2 日生效

欧盟要求所有 AI 生成音频必须进行机器可读水印标记。多数开源模型未内置水印,合规责任落于部署方。

4. AI 声音在嘈杂环境中比真人更易理解

UCL 研究:AI 声音在噪声中清晰度比真人高约 20%,跨越年龄和口音均一致。

五、📊 本周关键趋势

🔊 双向语音交互 — OpenAI Bidi、Gemini Live 突破"轮流说话",实现打断/插话/同步聆听

🔗 全连续架构崛起 — dots.tts、VibeVoice 抛弃离散 token,直接连续信号建模

🎯 词级精细控制 — ViiTorVoice-NAR(词级编辑)+ WordVoice(五维控制),从"读句"到"雕刻每词"

🏋️ MoE 大模型开源 — Audex (30B)、ZONOS2 (8B) Apache 2.0 开源,高质量 TTS 民主化

⚖️ 版权监管加速 — 中国专项整治 + EU AI Act Article 50 + 韩国日本立法讨论

🎭 AI 声音伦理博弈 — ElevenLabs 授权名人克隆 vs 灰色市场 ¥0.01 盗用