冻结翻译任务、方向与决定
- 判断问题
- 对这一源语言、目标语言、变体、领域、受众与下游用途而言,“翻译得好”具体意味着什么?
- 最低证据
- 逐字主张与日期;准确系统与链路版本;源到目标方向;内容类型、领域、语域、受众与后果;语义、术语、格式、时延与成本阈值。
- 停止条件
- 语言数量、精选演示或单一平均分替代明确语言方向、任务与决定边界时停止。
语言数量不是能力;流畅不是忠实
同一个系统可在一个方向和领域表现良好,却在反向翻译、方言、术语密集或长文档中失效。自动分数适合定位信号,不能替代可复现配置、源文对照、专家错误标注和真实流程验证。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、语言、译者、数据集或排行榜;不构成准确性、完整性、适用性或决策质量保证。
六道可拒绝的证据门
最低机器翻译主张失效矩阵
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
记录受影响的语言方向、源文类型、错误严重度、用户与决定;保留仍成立的最窄结论,并明确需要补样本、重跑、专家复核、人工翻译、限制使用还是撤回主张。
最低机器翻译能力评估记录
统一证据状态
准确链路在代表性证据上达到语义、语言、术语、格式、失败、成本与目标流程阈值,并有当前复核日期。
支持仅在明确方向、变体、领域、源文类型、术语控制、复核群体或运行条件下成立。
语义、关键错误、流畅度、术语、文档上下文、失败、译后编辑、时延或成本在不同分层间存在实质差异。
缺少方向、链路、源文溯源、参考译文质量、可复现指标、专家复核、完整分母、目标迁移或到期边界。
FUURAA 分析机器翻译能力主张的最小判断单位是“准确系统与链路版本 × 源语言、目标语言、方向、变体、领域、受众与决定 × 源文溯源、参考译文、分句、上下文与格式 × 提示、工具、术语表、翻译记忆与译后编辑 × 语义保持、术语、人名、数字、格式、流畅度与关键错误 × 全部项目、失败、修正、时延与成本 × 目标流程边界和截止日期”。BLEU、SacreBLEU、COMET、MQM、FLORES‑101 与 CCEval 分别照亮参考重合、可比报告、语义指标、专家错误、多语言长尾与中文中心评估;任何单项都不能独立证明真实翻译能力。
一手来源与不可外推边界
来源于 2026 年 8 月 29 日重新核对。每项保留发布日期、方法作用与不可外推边界。
提出语料级修正 n-gram 精确率与长度惩罚,用于相对人类参考译文的可复现比较。
边界参考译文重合度不能独立证明语义保持、术语、人名、数字、篇章、用户实用性或安全性。
打开一手来源 ↗2018 年 10 月发布SacreBLEU — A Call for Clarity in Reporting BLEU Scores证明分词与归一化选择会实质改变 BLEU,并提出带标准签名的可比报告方法。
边界可复现指标配置能提高可比性,但不会让指标变得完整,也不能验证源文、参考译文或目标流程。
打开一手来源 ↗2020 年 11 月发布COMET — A Neural Framework for MT Evaluation利用源文、候选译文与参考译文,并从多种人工判断中学习多语言质量估计。
边界在 WMT 数据上的相关性不能保证在另一语言方向、领域、错误严重度、模型版本或高影响决定中仍然校准。
打开一手来源 ↗2021 年发布MQM — Experts, Errors, and Context使用专业译者、明确错误类型与严重度以及完整文档上下文开展大规模人工评估。
边界两个 WMT 语言对与特定标注设计不能为所有用途提供通用分类、复核一致性或验收阈值。
打开一手来源 ↗2022 年发布FLORES-101 — Low-Resource and Multilingual MT Evaluation提供 101 种语言、3,001 条经专业翻译且完全对齐的句子,用于受控的多对多评估。
边界源于维基百科的句子不能覆盖所有方言、语域、文档、对话、术语系统、本地格式或生产后果。
打开一手来源 ↗2023 年 12 月发布CCEval — Chinese-Centric Multilingual Machine Translation中国团队主导的基准,对六个领域的多样中文源句进行溯源,并覆盖十一种目标语言及低资源方向。
边界中文中心句级基准不能证明文档级连贯、所有中文变体、专业术语、实时输入质量或运行中的译后编辑工作量。
打开一手来源 ↗继续核对