结果来自哪个准确模型、版本与评估设置?
- 证据处理规则
- 优先采用模型卡、系统卡、技术报告与可复现评估。
观察命题
适用边界基准或演示表现不能证明系统在特定部署中的可靠性、安全性或适用性。
本页把正式来源、FUURAA 原创摘要与分析明确分开;收录不代表合作、认可或背书。
本专题追踪什么
三组证据问题
已核验的一手来源
每项均标注正式发布日期、来源机构、证据类型、FUURAA 原创摘要及已知边界。
证据状态一手来源 · 产品发布
OpenAI 将 GPT-5.6 系列 Sol、Terra 与 Luna 从有限预览推进至正式开放,重点提升单位 token 的能力、程序化工具调用,以及面向复杂知识工作、编程、网络安全和科学任务的多智能体 ultra 模式。
证据边界能力、成本与基准比较均来自 OpenAI,应结合其评估方法和系统卡阅读;实际表现会随执行框架、推理强度及任务类型而变化。
打开正式来源 ↗2026 年 6 月 30 日 · AnthropicIntroducing Claude Sonnet 5证据状态一手来源 · 产品发布
Anthropic 将 Claude Sonnet 5 定位为最具智能体能力的 Sonnet 版本,可规划任务、使用浏览器与终端工具并执行更自主的工作,同时以较低成本缩小其与 Opus 在编程和知识工作上的差距。
证据边界自主程度仍取决于执行框架、权限、工具与人工复核;厂商基准优势不代表在所有工作负载中都能复现。
打开正式来源 ↗2026 年 5 月 28 日 · AnthropicIntroducing Claude Opus 4.8证据状态一手来源 · 产品发布
Claude Opus 4.8 强化了编程、工具调用、计算机操作和长时专业工作流,并同时推出可调推理强度、更低成本的快速模式,以及面向大规模并行智能体任务的动态工作流研究预览。
证据边界动态工作流当时仍属研究预览,并非默认开放能力;引用的客户结果也不是采用统一方法的第三方基准。
打开正式来源 ↗2026 年 4 月 23 日 · OpenAIIntroducing GPT-5.5证据状态一手来源 · 产品发布
GPT-5.5 扩展了 OpenAI 面向智能体编程、专业知识工作与科学研究的前沿模型能力,并于 4 月 24 日补充开放 API。该版本同时强调推理效率和更强的网络安全防护。
证据边界发布页同时采用厂商基准和部分外部评估;生产环境效果仍取决于任务设计、工具权限与提示方式。
打开正式来源 ↗2026 年 4 月 8 日 · Meta Superintelligence LabsIntroducing Muse Spark: Scaling Towards Personal Superintelligence证据状态一手来源 · 技术预览
Meta 发布原生多模态推理模型 Muse Spark,支持工具调用、视觉推理链与多智能体编排;模型进入 Meta 消费端产品,API 则从私人预览开始。
证据边界发布时 API 仅向有限用户开放,相关能力结论主要依据 Meta 自身的评估结果。
打开正式来源 ↗2026 年 3 月 27 日 · Meta AISAM 3.1: Faster and More Accessible Real-Time Video Detection and Tracking With Multiplexing and Global Reasoning证据状态一手来源 · 研究成果
SAM 3.1 通过对象多路复用和全局推理升级视频分割与追踪。Meta 报告其在单张 H100 上提升多对象实时追踪吞吐量,为视频理解与具身系统中的实用感知能力提供新路径。
证据边界吞吐量数据由厂商报告,并会受到追踪对象数量、硬件、分辨率和具体实现方式影响。
打开正式来源 ↗2026 年 3 月 10 日 · Google DeepMindGemini Embedding 2: Our first natively multimodal embedding model证据状态一手来源 · 技术预览
Gemini Embedding 2 首次把文字、图片、视频、音频和文档映射到同一表示空间,公开预览面向多模态检索、分类与搜索,减少过去必须组合多个编码器的复杂度。
证据边界本条记录对应公开预览阶段;Google 后续于 2026 年 4 月 22 日另行宣布正式开放。
打开正式来源 ↗2026 年 2 月 12 日 · Google DeepMindGemini 3 Deep Think: Advancing science, research and engineering证据状态一手来源 · 产品发布
Google 更新了 Gemini 3 Deep Think,把它定位为处理现代科学、工程与研究难题的专门推理模式;消费者可通过 Google AI Ultra 使用,API 则先以申请早期访问的方式推进。
证据边界发布时 API 尚未全面开放;基准成绩不能等同于系统已能可靠地自主完成科学发现。
打开正式来源 ↗FUURAA 分析
如何使用本专题把这些记录当作持续观察的起点,而不是行业全景、投资建议、认证结论或对未来的确定预测。来源更新、版本变化和独立复现都可能改变判断。
继续探索九大视角