更少的测量也可以支持模型规模预测
斯坦福研究人员提出项目反应缩放定律,通过选择信息量更高的评测项目,而非让每个模型完成全部问题。公开实验显示,该方法可在大幅减少查询的同时维持或提高预测效果。
FUURAA 原创概念视觉现有证据说明什么
《新的缩放定律方法可能改变AI模型训练方式》的核心主张
斯坦福研究人员提出项目反应缩放定律,通过选择信息量更高的评测项目,而非让每个模型完成全部问题。公开实验显示,该方法可在大幅减少查询的同时维持或提高预测效果。
FUURAA 编辑解读
解读《项目反应缩放定律》:多少次测量才真正足够?
项目反应缩放定律把昂贵的能力预测重新定义为测量问题:不再要求每个模型检查点回答每一道基准题,而是分别估计模型潜在能力与题目特征,再用少量高信息问题恢复缩放曲线。论文报告的查询节省非常显著,但它依赖既有校准、稳定的测量目标,以及真正能够区分模型的题目,并不意味着任何评估都可以随意缩减到几十道题。
一、《项目反应缩放定律》的核心主张
这项研究于2026年5月29日提交 arXiv,把项目反应理论引入神经模型缩放估计。传统评估把 M 个模型与 N 道题的每一组配对分别处理,工作量近似 M 乘 N;IRSL 则把响应结构分解为模型能力、题目难度与区分度,使参数复杂度趋近 M 加 N。论文采用的 Beta-IRT 还利用模型特有的概率信息,例如预训练中的词元概率或重复采样成功率,而不是把所有信息压缩成答对或答错。作者在十个基准、6,612个模型检查点和37,682道题上验证预训练预测,并以12个模型、四个基准和120道题进行规模较小的测试时研究。在一次性校准后,每个基准只使用50道题也能得到相当或更好的决策准确度。
二、节省来自信息利用,而不是忽略证据
同一主题下的两道题,测量价值可能完全不同。如果几乎所有模型都答对,或者几乎全部失败,这道题就很难区分当前关注的能力层级;难度合适且区分度较高的问题,可能提供更多信息。自适应测试利用已经校准的题目特征,选择最能缩小不确定性的项目。概率响应又增加了一层细节:模型对正确答案给出0.51与0.99的概率,不应被视为完全相同的证据。因此,IRSL 并不是宣称观察越少越好,而是说明经过测量模型组织、并按信息量选择的观察,可能优于数量很大却没有区分设计的查询集合。真正被减少的是重复和低信息测量,而不是必要证据。
三、99.9%的减少代表什么,又不代表什么
论文在已经完成校准的实验条件下报告每个基准问题数减少99.9%,这不等于训练一个前沿模型的总成本普遍下降99.9%。建立校准需要既有模型响应,题目参数可能随时间失效,研究仍需要模型检查点或重复采样来推断缩放关系。作者也明确报告:在极端噪声或题目过度同质的基准上,方法无法捕捉可靠趋势;在部分高质量基准中,传统概率缩放已经表现良好,IRSL 虽增加可解释性,却未必值得额外校准成本。因此,它是传统缩放方法的补充,而不是全面替代。公开报道必须区分评估查询节省、预测准确度与训练总经济成本,不能把三个概念合并成一个宣传数字。
四、实验室应怎样负责任地采用
采用前首先要说明预测服务于什么决定:选择训练数据配比、比较模型家族、估算测试时采样回报,还是预测更困难任务。团队应公开校准模型群、题目池、测量目标、查询预算及排名或曲线的不确定性,保留完全未参与选择的验证集,并在同等预算下与更简单基线比较。题目难度会受到提示方式、工具、语言、数据污染和模型架构影响,因此校准版本必须保存,并在重要条件改变后重新检验。只有当合理不确定性不会颠覆选择时,预测才适合触发高成本决定;如果不同方法仍可能给出相反排序,诚实结论应是继续测量,而不是强行输出确定答案。每次预测还应形成可追溯决定记录,至少包括采用的校准版本、被排除题目、异常响应处理、点估计与区间、备选方法结果以及最终决定人。模型正式训练或部署后,再把现实结果回填到记录中,检查预测误差来自缩放假设、题目参数还是执行条件。没有这一闭环,节省的查询只能证明一次统计实验成功,不能证明组织已经获得可靠的预测能力。
五、什么证据会加强或削弱这一主张
如果独立团队能够在新的模型家族、语言、多模态任务和真正前瞻性的训练决定中复现查询节省,可信度会提高;如果在大模型尚未训练时作出的预测,后来能够正确排序数据与架构选择,可信度还会进一步提高。相反,如果效果依赖已经进入训练的数据题库,校准只能在近乎相同的基准之间迁移,或者自适应选题系统性遗漏罕见但严重的失败,就应下调判断。还需要长期研究题目参数随模型与评估实践变化的速度。真正决定方法价值的问题,不是50道题曾经成功过一次,而是一个可审计流程能否反复判断何时50道题已经足够、何时绝对不够。
FUURAA 将来源报告的事实与编辑判断分开。合作方公布的结果不视为独立验证;结论仅适用于具名来源、日期、系统及已披露运行场景,不向其他机器人、行业或部署条件自动外推。
如何理解本条信息
已有公开依据的发展
相关事件、报告或研究结论已经公开,但其未来影响仍可能存在不确定性。



