盲听评审工具 · 2026 年 9 月 14 日

先听声音,再揭晓音色。

将清单中每个候选音色的参考录音与已保存的生成音频对比。选择语言,自述语言能力,再分别评价发音、自然度与说话人相似度。

已有 30 条样本 · 3 个音色 · 10 种语言 · 29 条成功输出 · 1 条保留失败。技术结果不等于音质评分。

开始本地试听评审

候选编号在不同语言间保持一致。重新开始会清除当前评分和音频,请先导出保存。本次页面访问中的揭晓记录仍会保留。

观测耗时:仅统计成功样本

成功样本数
n = 29
范围
58.990133.997
中位数
71.457
第 95 百分位
129.797

中位数与 p95 均采用最近秩法(nearest rank):升序排列后,取从 1 开始计数的 ceil(p × n) 位,p 分别为 0.50 与 0.95,不插值、不取两项平均。n=29 时,中位数取第 15 项,p95 取第 28 项。

仅统计 2026 年 9 月 14 日清单中的 29 条成功记录:中国区、短文本、串行请求。墙钟耗时包含排队、轮询、网络传输与下载,不是纯推理耗时,不代表 SLA、负载能力或美国区表现。失败样本耗时包含恢复暂停,单独呈现。

保留失败:FR · execution_recovered · 3150.496 秒(含恢复暂停)· 收费 $0.000000。该失败样本没有生成音频,也没有试听评分。

复现与解读评审

请保存本地导出文件。文件包含数字种子、完整展示顺序、输入文本哈希、生成音频预期哈希、实际加载音频哈希、语言能力自述,以及每项评分录入时是否已知音色身份。null 表示“未评分”;失败不会被换算成低分或省略。

清单提供同一预设音色的英文 referenceUrl 预览接口,但没有不可变的原始参考文件、转写或哈希。当前加载的参考字节会在本地计算哈希,无法验证其与历史原始录音一致。跨语言相似度判断也可能受不同文本和语言影响。

相同种子可复现候选音色映射与展示顺序,但不能证明由同一人试听,也不能证明实时参考接口仍返回相同录音。播放事件只是浏览器观测,不能证明完整或认真地听过。

随机化与校验方法

使用无符号 32 位种子和 Mulberry32 伪随机数生成器,先以 Fisher-Yates 算法打乱 manifest.plan.voices,再按 manifest.plan.languages 的顺序打乱各语言样本。每条样本额外取一次随机数,小于 0.5 时先展示参考录音。所有样本均保留,种子与完整顺序一起导出。

统一使用 SHA-256。输入文本按原样 UTF-8 编码,不作规范化。数据集按 JSON.stringify(解析后的清单) 的 UTF-8 字节计算,保留键与数组顺序、去掉空白;这不是清单原文件哈希。生成音频播放前与清单哈希核对。参考音频哈希来自实际加载并播放的字节,没有历史预期哈希。

已有恢复证据

已有第一方发布报告记录了在接单前封存、释放预留额度,且未为原失败样本提交替代生成。报告中的后续独立冒烟检查不替换失败,也不计入本数据集或耗时统计。此处不推导恢复时长或可靠性指标。

仓库来源: docs/voice-api-execution-recovery-release-2026-09-14.md。揭晓后可下载的机器证据与本地导出中包含其校验值和已有公开报告链接。

所有评测输入与结果仅来自 /examples/evaluation-20260914/manifest.json。单独的发布报告仅提供恢复背景。