B站上线AI无限竞技场大模型测评榜 GPT-6暂居榜首
B站推出汇集UP主真实场景实测的“AI无限竞技场”大模型测评榜,GPT-6 Astra在首轮测评中位列第一,前五名中国产模型占三席。该平台打破传统跑分模式,通过同题PK直观呈现模型差异,并公布过去一年AI内容消费时长显著增长的数据。
驱动中国9月20日消息,哔哩哔哩(B站)正式推出“AI 无限竞技场”大模型测评榜,并同步发布了首轮模型排名数据。根据榜单显示,GPT-6 Astra 在参与测评的 10 位 UP 主中取得第一名的成绩,并在击败 GLM-5.3 后获得榜首次数冠军。在排名前五的模型中,国产大模型占据了三个席位。
据 B 站官方介绍,“AI 无限竞技场”定位为汇聚平台 UP 主 AI 大模型测评内容的竞技广场。该榜单的评估体系基于各垂直领域 UP 主对上百个大模型进行的真实场景实测,测评主题涵盖代码生成、逻辑推理、协作能力以及知识问答等多个维度。
与传统依赖固定指标的跑分评测不同,“AI 无限竞技场”未设定具体的主题或测评维度限制。来自不同分区的 UP 主依据真实工作流、专业应用场景及趣味性创意等自主命题,通过同题 PK 的方式直观展示各模型在实际表现上的差异。目前,榜单已收录包括 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型在内的对比测评数据,排名机制支持实时更新,并持续面向全站 UP 主开放报名参与。
公开数据显示,过去一年间,B 站平台上的 AI 知识内容消费时长同比增长 72%,月均观看 AI 相关内容的用户数量超过 1.9 亿。平台内涌现出大量覆盖不同领域、维度及主题的测评内容,形成了从模型发布、用户讨论、实测评估、使用体验到求助反馈及共建优化的完整内容生态。