接近人类基线,GPT-6多模态理解能力显著提升|xbench月报

8月以来,前沿模型团队的迭代节奏进一步加快。截至9月8日,共有7家公司发布新的模型:OpenAI GPT-6 Astra、Anthropic Claude Fable 5.1、Google Gemini 3.8 Flash、阿里Qwen3.8-Max、DeepSeek V4-Flash与V4-Pro、智谱GLM-5.3,以及腾讯Hy4-preview。
xbench对这一批新模型从科学推理(ScienceQA)、多模态理解(BabyVision)、真实复杂长程任务(OneMillion-Bench)三个维度进行评测,并更新了leaderboard。
结合本期重点模型的公开发布信息与榜单数据,本轮迭代各个榜单的总结:
- GPT-6 Astra的多模态推理能力断层式领先,BabyVision首次有模型近Human baseline:GPT-6 Astra以88.92分登顶第一,距Human baseline(94.10)仅差 5.18分,领先第二名Gemini 3.7 Flash(73.45)15.47分,是榜单最大的第一名领先幅度。OpenAI视觉条线四代累计提升54.52分,多模态理解从差异化卖点正在变成模型核心竞争维度。
- ScienceQA头部密度持续上升,模型挤入70–80分区间:榜首仍是Claude Opus 4.8(76.4/84.0),但本月新增模型高度密集地落在69–75分区间:Claude Fable 5.1、GPT-6 Astra、Qwen3.8-max、Gemini 3.8 Flash、DeepSeek-V4-Flash 等均在此区间。分数上限未有明显突破,竞争转向效率与性价比。
- OneMillion-Bench榜单中Claude系列继续保持榜首,腾讯Hy4-preview跃升至第二:Claude Fable 5.1以PR42.1%登顶榜首,较上一代Fable 5(33.6%)提升 8.5个百分点,腾讯Hy4-preview以PR 35.3%从中下游位置直接跳到第二名。
BabyVision Leaderboard更新
BabyVision主要评估模型的多模态理解能力

本期BabyVision新增7款模型上榜(GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、Qwen3.8-Max、DeepSeek-V4-Flash-Vision-Exp、GLM-5.3-flash、Grok-4.6),多家公司第一次发布多模态版本。GPT-6 Astra 以 88.92分断层领先,是第一个距Human baseline 5分以内的模型。第一梯队的分水线从上期的60分档推进到70-80分档。
本期新上榜模型分数更新概览如下:
- GPT-6 Astra:88.92%,排名第1,距Human baseline(94.10)仅差5.18 分。较上一代GPT-5.6 Sol(66.75)跳涨+22.17,四代累计涨幅+54.52分,是所有厂商中多模态理解能力提升最稳定、涨幅最大的。
- Gemini 3.8 Flash:71.60%,去重后不占数字排名。较上一代Gemini 3.7 Flash(73.45)小幅回落1.85,Google Flash档位在多模态上延续持平策略,优势在速度与成本。
- Qwen3.8-Max:63.40%,排名第4。较上一代Qwen3.8-max-preview(64.95)略降1.55分,但相比Qwen3.7-plus(46.91)大幅提升+16.49。Qwen 首次把多模态并进万亿参数主力旗舰模型。
- Claude Fable 5.1:46.39%,排名第6。较上一代Fable 5(36.60)跳升+9.79,是Claude视觉线五代中单代最大涨幅,但仍在中游,距榜首差42.53 分。
- GLM-5.3-flash:36.60%,排名第7。智谱首款多模态模型,价格极低($0.075/$0.25)。
- DeepSeek-V4-Flash-Vision-Exp:30.15%,排名第8。DeepSeek首款多模态模型,价格同样极低($0.22/$0.66)。
- Grok-4.6:25.26%,去重后不占排名。较Grok-4.5(25.52)基本持平,xAI多模态仍是明显短板。

GPT-6 Astra将OpenAI连续四代的多模态理解趋势进一步推高,并扩大了其在 BabyVision上的领先优势。从分数涨幅可以看出,OpenAI在多模态理解的模型训练上,有非常大的突破。
- GPT-6 Astra在BabyVision上以88.92分登顶第一,接近Human baseline:GPT-6 Astra距Human baseline(94.10)仅差5.18分,是首个接近 Human baseline的模型。此前从未有模型在BabyVision上突破80分,GPT-6 Astra直接跳过80分档进入88分档。
- GPT-6 Astra在BabyVision上的大幅领先领先第二名Gemini 3.7 Flash(73.45)15.47分:此前的第一梯队70+分数,由Gemini系列(Gemini 3.7 Flash 73.45、Gemini 3.8 Flash 71.6)占据。Doubao-Seed-2.1-pro(66.89)、GPT-5.6 Sol(66.75)位于第2梯队60+分数。GPT-6 Astra的 88.92一举超过Gemini,独占80+分数区间。与第二名的差距(15.47分)大于第二名Gemini 3.7 Flash与第六名Claude Fable 5.1之间的差距(73.45- 46.39=27.06)。
- OpenAI多模态理解能力连续4代持续提升,累计提升54.52分:GPT-5.2(34.40)→GPT-5.5(54.64,+20.24)→GPT-5.6 Sol(66.75,+12.11)→GPT-6 Astra(88.92,+22.17)。从GPT-5.2(34.40)到GPT-6 Astra(88.92),分数增长×2.58。不到一年时间内从BabyVision中游,跃居第一。
- GPT-6 Astra单代提升+22.17分,超过了同期所有其他厂商的单代最大涨幅:作为对比,Anthropic视觉线单代最大涨幅为Opus 4.8→Fable 5的 +13.15分,ByteDance从Doubao-Seed-2.0-pro(62.60)到Seed-2.1-pro(66.89)仅提升+4.29分。

多模态能力增速明显变快,Fable两代成为主要增量来源。
- BabyVision五代累计提升3.27倍,但增量高度集中在Fable阶段:Opus 4.8版本以前多模态理解能力是缓慢提升,从OpusOpus 4.8→Fable 5(36.60,+13.15)→Fable 5.1(46.39,+9.79)是连续两代加速。从Opus 4.5到Fable 5.1,BabyVision得分从14.20升至46.39(×3.27),视觉是Anthropic近三代提升幅度最大的单项能力。
- Fable 5.1的新增能力仍明显偏向视觉:BabyVision+9.79,远高于ScienceQA的+1.2,延续了“视觉增量大于推理增量”的趋势,提升重点也更集中在文档、图表、表格等复杂视觉信息处理。
- 多模态场景的性价比较差:Fable 5.1每分BabyVision对应$1.08 output cost($50/46.39),Gemini 3.7 Flash仅$0.051/分($3.75/73.45),Doubao-Seed-2.1-pro为$0.066/分($4.42/66.89)。Fable 5.1的性价比约为Gemini 3.7 Flash的1/21、Doubao的1/16。多模态能力在追,但价格结构没变,性价比差距仍是一个数量级。

Qwen3.8-max延续统一多模态旗舰路线,视觉能力较早期独立VL系列实现阶梯式跃升。
- Qwen系列,在BabyVision上从19.20提升至最高64.95,主要增量集中在 Qwen3.5与Qwen3.8两个节点:早期Qwen3-VL-Plus/VL-235B分别为19.20 /22.20;随后Qwen3.5-397B较VL-235B跃升+21.10,Qwen3.7-plus再小幅提升+3.61,至Qwen3.8-max-preview又出现第二次明显跃升(+18.04)。
- Qwen3.8-max-preview创下当前最高分,但正式版较preview小幅回落1.55分:Qwen3.8-max-preview(64.95)→Qwen3.8-max(63.40),说明正式版视觉能力整体与preview接近,相比榜首GPT-6 Astra(88.92)仍有25.52分差距。
- 重点变化是多模态能力从独立VL产品线进入通用旗舰主线:早期Qwen3-VL 仍以独立Vision-Language系列存在,从Qwen3.5起,视觉能力不再依赖独立 VL命名,而成为通用模型的原生能力,之后Qwen3.7-plus、Qwen3.8-max 均延续这统一多模态路线。
xbench-ScienceQA Leaderboard更新
ScienceQA主要评估模型的科学知识和推理能力

本期新模型均在ScienceQA榜单上进行更新。榜首仍是Claude Opus 4.8(76.4/BoN 84.0),本月新模型高度密集地落在70–76分区间:Claude Fable 5.1(74.6)、GPT-6 Astra(74.6)、Qwen3.8-max(73.4)、Gemini 3.8 Flash(72.4)、DeepSeek-V4-Flash(71.0)等均在此区间。头部竞争的密度明显上升,但分数上限仍未突破Opus 4.8的76.4分。
本期新上榜模型分数更新概览如下:
- Claude Fable 5.1:74.6/BoN 84.0,去重后不占排名,与GPT-6 Astra平均分并列。较上一代Fable 5(73.4/83.0)回升+1.2/+1.0,修复了Fable 5的代际回调,BoN追平Opus 4.8的84.0。响应13.41s,500题仅$22.7,是同分段中效率最高的模型。
- GPT-6 Astra:74.6/BoN 82.0,排名第2。较GPT-5.6 Sol(71.0/78.0)提升+3.6/+4.0,创OpenAI历代新高。Output Tokens 6301.0(Fable 5.1的7.5倍)、响应82.60s、500题$192.6(Fable 5.1的8.5倍),推理价格在榜单中偏高。
- Qwen3.8-max:73.4/BoN 82.0,排名第3。较上一代Qwen3.7-max(70.8/79.0)提升+2.6/+3.0,BoN冲到82.0(与GPT-6 Astra持平),均分也首次突破73分。
- Gemini 3.8 Flash:72.4/BoN 79.0,排名第5(去重后)。较上一代Gemini 3.7 Flash(70.2/81.0)均分提升+2.2但BoN回落2.0分。Flash档位继续以低价($0.75/$3.75)和快速响应(7.31s)为优势和卖点。
- Deepseek-V4-Flash:71.0/BoN 80.0,排名第7。是DeepSeek五代(V3.2-Think→V4-Flash)中均分最高的,较V4-Pro(69.4/81.0)均分高+1.6但 BoN低1.0。以Thinking+max模式达到71.0,价格远低于旗舰。
- Grok-4.6:70.4/BoN 77.0,去重后不占排名。较Grok-4.5(72.4/81.0)回落2.0/4.0分,是xAI两代之间少见的分数下降,可能与版本切换有关。
- Hy4-preview:69.8/BoN 79.0,排名第9。较上一代Hy3(66.6/80.0)均分提升+3.2但BoN略降1.0。腾讯在科学推理上稳步提升。
- Deepseek-V4-Pro:69.4/BoN 81.0,去重后不占排名。是V4系列的旗舰版本,BoN 81.0为DeepSeek历代最高。
- GLM-5.3:65.8/BoN 80.0,排名第10。较上一代GLM-5.2(64.6/77.0)提升+1.2/+3.0,其中BoN提升更明显。

GPT-6 Astra在ScienceQA上刷新OpenAI四代最高分,同时推理速度提升。
- GPT-6 Astra平均分74.6/BoN 82.0,排名第二,与Claude Fable 5.1(74.6/84.0)平均分并列,BoN低2.0分:排名第一的Claude Opus 4.8(76.4/ 84.0)领先GPT-6 Astra 1.8分。GPT-6 Astra是OpenAI历代在ScienceQA上的最高分,较上一代GPT-5.5 Pro(73.0/80.0)提升1.6分/2.0分。
- GPT-6 Astra与Fable 5.1分数相近,但是推理开销较高:响应时间为82.60 秒,是Claude Opus 4.8(24.27秒)的3.4倍、Claude Fable 5.1(13.41 秒)的6.2倍。平均Output Tokens达6301.0,分别是Fable 5.1(839.3)的 7.5倍和Opus 4.8(1978.0)的3.2倍。
- GPT系列价格偏高,500题花费$192.6,是榜单中最贵的模型之一:对比Claude Fable 5.1($22.7)贵8.5倍,对比Claude Opus 4.8($25.6)贵7.5 倍。高token消耗叠加$50/MTok的output定价,使得GPT-6 Astra在ScienceQA上的使用成本高于同分段竞品。此前价格较高的模型,均为GPT系列。
- OpenAI近四代模型在ScienceQA上分数较为稳定,有小幅提升:GPT-5.4(70.8)→GPT-5.5 Pro(73.0,+2.2)→GPT-5.6 Sol(71.0,-2.0)→GPT-6 Astra(74.6,+3.6)累计提升+3.8分。BoN分数79.0→80.0→78.0→82.0。GPT-6 Astra的BoN 82.0是OpenAI历代最高,但与Claude Opus 4.8/Fable 5.1的84.0仍差2.0分。
- 推理速度提升:与此前分数最相近的模型GPT-5.5 Pro相比,响应时间从GPT-5.5 Pro的156.99降至GPT-6 Astra的82.60秒,降幅47%。Output Tokens从 5192.7略微增加至6301.0(+21%)。

Fable 5.1在ScienceQA上较Fable 5提升,同时延续Fable系列的低时延趋势。
- Fable 5.1平均分74.6/BoN 84.0,位于Opus 4.8(76.4/84.0)之后,Fable 5(73.4/83.0)之前:BoN追平Opus 4.8的84.0,意味着Fable 5.1在五次采样中的最佳表现已经触及Opus 4.8的上限,差距也仅存在于单次作答的稳定性(Average差1.8分)。
- 响应速度和 token 效率继续提升,远超其他同分数段模型:Fable 5.1响应时间13.41秒,比Fable 5(16.85秒)快20%,比Opus 4.8(24.27秒)快45%。平均Outadapput Tokens 839.3,比Fable 5(1108.2)少24%,比Opus 4.8(1978.0)少58%。动态推理在5.1上进一步压缩了推理链长度,用更少的token达到更高的分数。
- 能力提升的同时,Fable 5.1延续了同价提效的趋势,速度和token消耗进一步优化:500题花费为$22.7,较Fable 5的$26.8下降15%,较Opus 4.8的$25.6低11%。在同样$10/$50的定价下,更低的token消耗直接转化为更低的实际推理成本,这也是Fable系列单价不变、效率提升路线的核心逻辑。
- 3道题目触发拒答,均为生命科学方向。与官方给出的网络安全和生命科学方向一致。

- Fable系列模型在科学推理中能力保持稳定。Opus 4.6(58.8)→Opus 4.7(73.0)→Opus 4.8(76.4)→Fable 5(73.4)→Fable 5.1(74.6),BoN(N=5)在83-84分浮动。近3版模型的Average分数和BoN(N=5)分数基本保持一致。
- 响应时间持续下降:Opus 4.8(24.27s)→Fable 5(16.85s)→Fable 5.1(13.41s)。这三个版本之间分数基本持平(76.4→73.4→74.6),但响应时间稳步走低,说明模型能用更少的计算达到相近的分数。这与Anthropic的说法一致,官方称Fable 5.1在Low/Medium effort档位下即可达到与Fable 5相当或更好的表现,成本更低。

DeepSeek-V4-Flash延续五代上升趋势,并以低价档位拿下DeepSeek系列最高均分。
- 五代均分从61.4升至71.0,累计+9.6分:V3.2-Think(61.4)→V3.2-Spec(62.6,+1.2)→V4-preview(64.6,+2.0)→V4-Pro(69.4,+4.8)→V4-Flash(71.0,+1.6)。真正的跃迁发生在V4-Pro一代(+4.8),V4-Flash 在此基础上继续小幅提升。
- V4-Flash的核心价值在于以Flash档位逼近Pro水平:V4-Flash均分71.0,高于V4-Pro的69.4,但V4-Pro的BoN 81.0略高于V4-Flash的80.0,两者互有胜负。整体看,Flash在接近Pro能力水平的同时提供更偏性价比的产品定位。
$OneMillion-Bench Leaderboard更新
$OneMillion-Bench主要评估模型执行专业复杂任务的能力

本期OneMillion-Bench新增5款模型入榜(Hy4-preview、GLM-5.3、GPT-6 Astra、Deepseek-V4-Pro、Gemini 3.8 Flash),均为Base模式。榜单格局发生显著变化:Claude Fable 5.1以PR 42.1%登顶榜首,腾讯Hy4-preview 以PR 35.3%跃升至第二名,是本期最大的排名变动。
本期新上榜模型分数更新概览如下(均为Base模式):
- Hy4-preview:Pass 35.3/Avg 54.4/EV $293,346,排名第2。较上一代 Hy3(Pass 13.0/Avg 38.8)PR跳升+22.3个百分点,是本期所有模型中单代 Pass Rate涨幅最大的。从OneMillion中下游直接跳到第二名,长程任务处理能力实现质变。
- GLM-5.3:Pass 31.0/Avg 53.9/EV $316,958,排名第6。智谱GLM-5.3入榜OneMillion,Avg 53.9%高于多款旗舰模型(GPT-6 Astra 50.2%、Claude-Opus-4.6 51.4%),说明GLM-5.3在长程任务上有较好的基础能力。
- GPT-6 Astra:Pass 27.8/Avg 50.2/EV $348,092,去重后不占排名。低于自家上一代GPT-5.6 Sol(Pass 32.2/Avg 53.8),出现代际回调。但EV从 $325,064升至$348,092,说明新增通过的任务集中在高价值区间。
- Deepseek-V4-Pro:Pass 26.0/Avg 49.4/EV $284,256,排名第7。DeepSeek在长程任务上的表现中规中矩,落后于Kimi K3(35.0)和 Qwen3.8-max-preview(31.9)等国产竞品。
- Gemini 3.8 Flash:Pass 22.0/Avg 47.3/EV $240,577,去重后不占排名。较上一代Gemini 3.7 Flash(Pass 22.5/Avg 48.8)小幅回落,Flash档位在长程任务上的提升空间有限。

GPT-6 Astra在OneMillion-Bench上没有明显提升。
- GPT-6 Astra在OneMillion-Bench上Pass Rate 27.8%,低于自家上一代 GPT-5.6 Sol(32.2%):GPT-6 Astra排在Claude-Opus-4.6(29.5%)之后,距榜首Claude Fable 5.1(42.1%)差14.3个百分点。这是GPT-6 Astra三张榜单中唯一出现分数下降的维度。OpenAI在真实任务处理中,尚需提升。
- Average从GPT-5.6 Sol的53.8%降至50.2%,Economic Value从 $325,064升至$348,092:Pass Rate和Average同时下降但Economic Value 上升,说明GPT-6 Astra新增通过的任务集中在高价值区间,解决复杂问题的能力提升。
- OpenAI的3代模型在OneMillion-Bench上的Pass Rate没有明显提高:三代模型的Pass Rate分别为26.5%(GPT5.5)、32.2%(GPT-5.6 Sol)、27.8%(GPT-6 Astra),GPT-5.6 Sol是OpenAI在OneMillion上的历史最佳,GPT-6 Astra未能延续上升趋势。最高仅32.2%,远低于Claude Fable 5.1(42.1%)和Hy4preview(35.3%)。
- Average分数没有提升,反而略有下降:51.3→53.8→50.2:GPT-6 Astra 的Average 50.2%甚至低于GPT 5.5的51.3%,是三代中最低。
- Economic Value持续上升:$291,065→$325,064→$348,092,说明GPT-6 Astra虽然通过的任务数量减少,但通过的任务经济价值更高,更擅长解决复杂问题。

Fable 5.1将Claude长程任务能力推至新高。
- Fable 5.1以Pass Rate 42.1%登顶OneMillion-Bench第一:领先第二名Hy4 preview(35.3%)6.8个百分点,领先第三名Kimi k3(35.0%)7.1个百分点。这是Anthropic在OneMillion-Bench上的最佳成绩,也是所有模型首次突破40% Pass Rate。
- Pass Rate在Opus 4.8回调后连续两代攀升:29.5→15.8→33.6→42.1。Opus 4.6(29.5%)→Opus 4.8(15.8%,-13.7)→Fable 5(33.6%,+17.8)→Fable 5.1(42.1%,+8.5)。Opus 4.8构成这一阶段的明显低点,Fable系列随后连续两代修复,Fable 5.1创下Anthropic当前最高Pass Rate。
- Fable 5.1不仅提高了任务完成率,也把领先优势延伸到高价值任务的完成上:Economic Value从$340,156降至$217,790后连续回升至$443,213;Fable 5.1为全榜最高,比第二名Kimi K3($356,228)高$86,985,显示其在高价值长程任务上的领先更加明显。
- Fable 5.1不仅提高了任务完成率,也把领先优势延伸到高价值任务的完成上:Economic Value从$340,156降至$217,790后连续回升至$443,213;Fable 5.1为全榜最高,比第二名Kimi K3($356,228)高$86,985,显示其在高价值长程任务上的领先更加明显。

腾讯Hy系列在OneMillion上实现了从中下游到第二的跃迁,Hy4-preview 是本期最大的长程任务黑马。
- 三代Pass Rate呈加速上升:8.5→13.0→35.3,hy3-preview(8.5%)→ Hy3(13.0%,+4.5)→Hy4-preview(35.3%,+22.3)。Hy4-preview实现了一次质变式的跳跃(+22.3个百分点),PR直接从13.0%跳到35.3%,单代涨幅是前两代累计的5倍。
- Average同步大幅提升:34.6→38.8→54.4,Hy4-preview的Avg 54.4%已接近Kimi K3(56.9%)和Claude Fable 5(55.9%),从长程任务的中下游一步跨入头部区间。
- Economic Value从$93,990升至$293,346,三代增长×3.12:但距榜首 Claude Fable 5.1($443,213)仍有较大差距,说明Hy4-preview新增通过的任务在经济价值分布上偏向中等价值区间,尚未覆盖最高价值的复杂任务集。
近期发布模型总结
OpenAI GPT-6 Astra(OpenAI,2026.9.5)
GPT-6 Astra是OpenAI最新旗舰模型,支持105万token context、128K最大输出,以及low/medium/high/xhigh/max五档reasoning effort,产品定位也从单纯对话/推理进一步转向computer use、浏览、代码、科研与复杂端到端工作流。Astra同时支持computer use、web search、code interpreter等工具,并新增异步工具调用,强化长流程Agent执行。定价$10/$50 per MTok,GPT-6 Astra在xbench的BabyVision中以88.92分登顶第一并领先第二名15.47分,距Human baseline仅5.18分,是所有模型中最接近人类表现的。ScienceQA 74.6/BoN 82.0创OpenAI历代新高,排名第二,但推理开销(Output Tokens 6301、响应82.60s、500题$192.6)为同分段最贵。OneMillion-Bench PR 27.8%低于上一代GPT-5.6 Sol(32.2%),出现代际回调。GPT-6 Astra的核心价值在视觉/多模态理解训练上上的重大突破,而长程任务通过率并未同步提升。OpenAI官方同样将Astra的主要升级集中在computer use、专业工作、科学研究和复杂多步任务上。
Claude Fable 5.1(Anthropic,2026.9.2)
Claude Fable 5.1是Anthropic Fable系列第二代,支持1M context、128K最大输出,并采用always-on Adaptive Thinking,可通过effort动态调节推理深度。官方将其定位于demanding reasoning、long-horizon agentic work,并重点强化长时间Agent编程、多步研究以及文档、表格和PPT工作流。定价维持$10/$50 per MTok,但cache read从Fable 5大幅降至$0.25/MTok,Anthropic估算可使典型workload成本下降约25%、高度agentic workload下降最高约45%。ScienceQA 74.6/BoN 84.0,BoN追平Opus 4.8,OneMillion-Bench PR 42.1%登顶榜首,EV $443,213为全榜最高。BabyVision 46.39%,排名第6,视觉能力仍在中游但延续长期上升趋势。因此,Fable 5.1的核心优势集中在推理效率与长程任务执行,ScienceQA响应仅13.41s、500题$22.7,是同分段成本较低的模型,OneMillion表现也与Anthropic强调的long-running agents、失败恢复和多步任务执行方向较为一致。
Gemini 3.8 Flash(Google,2026.9.3)
Gemini 3.8 Flash是Google Flash产品线最新一代,支持1M token context、64K最大输出,并支持low/medium/high三档thinking:输入原生覆盖文本、图像、视频、音频和PDF,同时支持code execution、computer use、search grounding和function calling。Google将它定义为最新的“workhorse model”,产品重点放在long-horizon software engineering、autonomous agents和复杂enterprise workflows。官方指出,3.8在复杂任务上会主动增加reasoning steps和工具调用,因此并非单纯追求减少token。当前定价为$0.75/$3.75 per MTok。ScienceQA 72.4/BoN 79.0(排名第5),较Gemini 3.7 Flash(70.2/81.0)均分提升但BoN回落:BabyVision 71.60%,较3.7Flash(73.45)小幅回落,OneMillion PR 22.0%,与3.7 Flash(22.5%)基本持平。本代并未体现为三项基础能力分数的全面跃升,更明显的产品升级方向是将Flash的低成本定位进一步延伸至长程Coding与Agent工作流。
阿里Qwen3.8-Max(Alibaba,2026.8.4)
Qwen3.8-Max是阿里Qwen首个万亿参数级统一旗舰,底层Qwen3.8-2.4T-A95B采用MoE架构,总参数达到2.4T、每token激活约95B,并支持最高1M token context,Max 产品版进一步加入原生视觉输入、thinking / non-thinking、官方内置工具等能力。阿里官方将其定位于coding、professional work、research与long-horizon agentic tasks,并强调复杂多步任务的持续执行能力。ScienceQA 73.4/BoN 82.0(排名第3,国产第一),较上一代Qwen3.7-max(70.8/79.0)提升+2.6/+3.0;BabyVision 63.40%(排名第4),较Qwen3.7-plus(46.91)大幅提升+16.49,OneMillion榜上Qwen3.8-max-preview以PR 31.9%排名第5。Qwen3.8的技术和产品变化都比较明确,一方面把模型规模提升至2.4T/95B active,另一方面将原生多模态、Agentic Coding/办公和长上下文统一进同一款Max旗舰,能力覆盖面明显扩宽。
腾讯Hy4-preview(Tencent,2026.8.28)
Hy4-preview是腾讯混元系列最新preview版本,采用770B总参数、49B激活参数的稀疏模型配置,支持1M context(最大输入960K、最大输出64K)。腾讯将其定位为“新一代生产力模型”,重点面向Agent、Coding与生产力场景,强化复杂任务中的理解、规划、工具调用和持续执行。ScienceQA 69.8/BoN 79.0(排名第9),较Hy3(66.6/80.0)均分提升+3.2,OneMillion-Bench PR 35.3%/Avg 54.4%,排名第2,较Hy3(13.0%/38.8%)实现明显跃升,PR +22.3个百分点,是本期所有模型中最大的单代OneMillion涨幅。Hy4-preview的增量与官方Agent/复杂任务执行定位较为吻合,长程任务提升远大于纯知识推理提升。OneMillion是本期明显亮点,而ScienceQA仍落后头部约7分,知识推理能力仍有提升空间。
DeepSeek V4系列(DeepSeek,2026.8.13)
DeepSeek V4延续MoE路线,并进一步拉开Pro/Flash两档配置:V4-Pro为1.6T总参数/49B激活参数,V4-Flash为284B/13B激活参数,两者均支持1M context,并提供low/high/max等可调reasoning effort。官方重点强调本代在长上下文推理效率、Agent能力和复杂任务执行上的优化,8月正式版进一步增强了Agent与API工作流支持。本期V4-Pro(Thinking+max)和V4-Flash(Thinking+max)均入榜:ScienceQA上,V4-Flash为71.0/BoN 80.0(排名第7),V4-Pro为69.4/81.0,两者在Average与BoN上各有优势;BabyVision上V4-Flash-Vision-Exp为30.15%,官方将其定位为实验性多模态版本,OneMillion-Bench上V4-Pro PR 26.0%/Avg 49.4%。DeepSeek V4不只是通过Pro/Flash做价格分层,而是用不同激活规模覆盖不同性能与成本需求,再通过可调reasoning effort进一步平衡能力、延迟和成本。
智谱GLM-5.3(Z.ai,2026.8.14/8.27)
GLM-5.3主模型约753B参数,直接沿用GLM-5.2的base model:官方明确表示,本代主要增量来自post-training,而不是继续扩大基础模型规模,重点强化complex coding、long-horizon tasks和Agent能力,并支持low/high/max三档reasoning effort。视觉榜使用的GLM-5.3-Flash则走另一条效率/多模态路线:320B总参数、18B active,是GLM-5系列首个原生多模态模型,并在大规模multimodal corpus上训练。本期GLM-5.3以Thinking+max模式入榜ScienceQA(65.8/80.0,排名第10),以Flash版本入榜BabyVision(36.60%,排名第7),以Base模式入榜OneMillion(PR 31.0%/Avg 53.9%,排名第6)。ScienceQA较上一代GLM-5.2(64.6/77.0)小幅提升,BoN+3.0;OneMillion Avg 53.9%高于多款旗舰。GLM-5.3本代的核心不再继续堆参数,而在通过post-training强化Coding/长程Agent能力,同时用Flash提供更轻量的原生多模态路线,两条产品线分别覆盖能力上限和推理效率。
xbench 是红杉中国推出的一款全新的 AI 基准测试工具。xbench 采用双轨评估体系,构建多维度测评数据集,旨在同时追踪模型的理论能力上限与 Agent 的实际落地价值。并采用长青评估的机制,通过持续并动态更新测试内容,以确保时效性和相关性。
联系方式:team@xbench.org