xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,准确率较 1.0 翻倍
xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。 via AIHOT ·
来源:AI HOT 精选
阅读原文xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。 via AIHOT ·
Krea 宣布 FLUX 3 Image 已上线其平台。新能力包括多轮编辑且不改动其他像素、用 bounding box 排版图像、最高 4K 生成,以及组合最多 10 个参考图。 via AIHOT ·
Black Forest Labs 的 FLUX 3 Image 现已上线 OpenRouter,是支持文生图与多参考编辑的旗舰图像模型,原生可渲染至 4K。原文提到可精确多轮编辑不动其他像素、用 bounding box 布局、最多用 10 个参考图合成,商业权重已开放,开放权重版将在未来数周发布。 via AIHOT ·
Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。 via AIHOT ·