B 站上线「AI 无限竞技场」:10 位 UP 主实测上百款大模型,GPT-6 Astra 登顶、GLM-5.3 紧随

B 站上线「AI 无限竞技场」:10 位 UP 主实测上百款大模型,GPT-6 Astra 登顶、GLM-5.3 紧随

Author: tengdy | Create: 2026-09-21 09:23:56 | Update: 2026-09-21 09:23:56 | 分类:大模型

GPT-6 AstraB 站AI 无限竞技场UP 主实测GLM-5.3评测新形态

title: "B 站上线「AI 无限竞技场」:10 位 UP 主实测上百款大模型,GPT-6 Astra 登顶、GLM-5.3 紧随" slug: bilibili-ai-arena-up-creators-real-world-benchmark date: 2026-09-21 category: 大模型 tags: B 站,AI 无限竞技场,UP 主实测,GPT-6 Astra,GLM-5.3,评测新形态 summary: B 站推出「AI 无限竞技场」榜单,首轮 10 位 UP 主对上百款大模型真机实测,结果 GPT-6 Astra 登顶,GLM-5.3 紧随,前五名中有三款国产大模型。这种「UP 主真人实测」正在从标准化 benchmark 之外,补出真实用户体验维度。


B 站上线「AI 无限竞技场」:10 位 UP 主实测上百款大模型,GPT-6 Astra 登顶、GLM-5.3 紧随

传统 benchmark 像标准化考试,B 站新上线的 「AI 无限竞技场」 则像实战演习。9 月 20 日 B 站正式推出这一新型评测榜单,首轮排名已揭晓:10 位来自不同领域的 UP 主对上百款大模型做真机实测,没有固定评测维度、没有标准答案——有人现场改 bug、有人模拟客服吵架、有人拿模型写反转短剧。榜单实时更新,全平台开放报名。

一、首批战报:GPT-6 Astra 第一,国产占三席

首轮实测排名前五:

  1. GPT-6 Astra
  2. GLM-5.3(智谱)
  3. Claude 4.0 Sonnet
  4. DeepSeek V4.1 Pro
  5. Kimi K3 Max

前五名里有 三款国产大模型——GLM-5.3、DeepSeek V4.1 Pro、Kimi K3 Max 悉数上榜,豆包、千问、混元、MiniMax 等主流国产模型也全程参战。这意味着在「真人实操、结果导向」的评测维度上,国产模型已经能够稳定占据头部位置,不再依赖榜单分数证明自己

这种评测方式与传统 benchmark 有一个根本性的差别:传统 benchmark 测的是「模型能不能在固定题目上答出标准答案」,AI 无限竞技场测的是「这模型到底能不能把活干漂亮」。

二、为什么「UP 主实测」会变成一种新评测形态

传统大模型评测体系在过去一年遇到了三个问题:

  1. 刷榜过拟合——MMLU、GSM8K、HumanEval 这类公开榜单已经成为模型微调的优化目标,分数越来越难以反映真实能力。
  2. 「长尾能力」难以触达——编码 Agent、长程任务、多模态协同、企业级工具调用等能力,传统 benchmark 覆盖不全。
  3. 用户体验被忽略——回答的流畅度、是否抓住用户真实意图、是否能在多次交互后保持上下文一致性,这些都没有标准答案,但恰恰是用户最在意的事。

B 站的 AI 无限竞技场把这三件事一次性补上:

  • 场景来源真实:由 10 位不同领域 UP 主各自出题,覆盖二次元写作、客服对峙、代码调试、剧情反转、产品文案、视频脚本等几十种真实工作流。
  • 评测过程开放:评测过程在 B 站全平台直播,UP 主与模型的全部对话可回看,评测者本身也被评测
  • 结果主观但可复现:UP 主根据自身领域经验给出综合判断,附带过程截图与对话录屏,用户可以重放同一个 prompt 看其他模型表现。

这种模式的本质是把评测权从「少数评测机构」下放到了「领域创作者」,让评测者本身更接近真实用户。

三、对开发者和企业的实际意义

AI 无限竞技场的出现,会影响未来几个月 AI 工具的几个使用习惯:

  1. 采购与选型:当企业要选一款主力大模型时,「GPT-6 Astra 在哪些场景翻车」「GLM-5.3 写代码之外能不能写好产品文案」这种问题,可以直接去 AI 无限竞技场看 UP 主实操,比跑一遍内部 PoC 更高效
  2. Prompt 工程:UP 主在直播里展示的 prompt 工程技巧——比如怎么让模型「先承认不会」再给答案、怎么用「写作约束清单」逼模型写长内容——本身就是一份可复用的工作流素材。
  3. 国产模型的市场认知:榜单里国产模型已经稳定占据前五中的三席,这会直接影响下一波企业采购的 RFP——国产主力档不再是陪跑,而是默认选项之一
  4. 评测本身的开放化:B 站把评测流程全公开,意味着其他平台(小红书、抖音、知乎、视频号)也会陆续推出类似形态,评测会从「机构权威」转向「创作者真实记录」

四、它补的不是谁,而是 benchmark 之外的一格

AI 无限竞技场不会替代 Artificial Analysis、LiveBench、AA-Intelligence Index 这类传统榜单。传统榜单解决的是「这模型在某个标准任务上做到了什么程度」,AI 无限竞技场解决的是「这模型在真人手里能不能把活干漂亮」——前者是科学测量,后者是用户感知。

当一个模型在所有 benchmark 上都刷到接近满分、但 UP 主实测时仍然「写出来的东西没人愿意读」时,问题出在哪?出在评测目标与真实用户体验脱节。AI 无限竞技场把这个鸿沟第一次暴露在主流视野里。

结语

B 站 AI 无限竞技场最值得关注的地方,不是「GPT-6 Astra 登顶」这个结论本身,而是它确立的评测新形态:真实用户 + 真实场景 + 公开过程 + 实时更新。这套机制一旦跑通,会成为接下来一年国产大模型市场认知的重要基础设施。当评价权从评测机构转向创作者,「榜单分数 + UP 主实测」会成为新的双轨标准——而在这条双轨上,国产模型已经站到了该站的位置。

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.