阶跃发布Step 5 Preview:开源前三,10月开源

AI 驱动中国 许棠 359次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

阶跃宣布推出旗舰模型Step 5 Preview,采用稀疏MoE架构,总参数量600B,激活参数27B,支持100万Token上下文。该模型在AA榜单位居全球开源前三,单任务成本仅为Claude Opus 5的八分之一,计划于10月15日开源完整权重。

驱动中国9月20日消息,阶跃今日宣布推出旗舰模型Step 5 Preview。该模型面向AI编程、软件工程、专业知识工作及金融等场景,旨在提升模型执行真实世界Agentic任务的表现。官方计划于10月15日开源完整模型权重。

在架构设计上,Step 5 Preview采用稀疏MoE混合专家架构,总参数量为600B,激活参数仅27B。该模型支持100万Token上下文窗口,并原生支持文本与视觉输入。

根据全球人工智能权威榜单Artificial Analysis Intelligence Index(AA综合智能指数)的数据,Step 5 Preview得分44分,位列全球开源模型前三。在成本方面,该模型的单任务成本仅为Anthropic Claude Opus 5的八分之一。

为优化代码能力,阶跃建立了StepCodeBench评测体系,覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言。测试结果显示,Step 5 Preview能够处理多种编程语言,并胜任Bug修复、功能开发、代码重构及环境配置等真实开发任务。

在具身智能与硬件交互方面,该模型展示了自主阅读ESP32设备及相关API开发文档的能力。通过将一块ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘,模型不仅能编写代码,还能访问串口、获取截图、调用摄像头、模拟鼠标操作,并依据真实设备返回的状态和报错持续修改、运行和调试代码,连续执行时间超过3小时。

在公开和内部评估中,Step 5 Preview在复杂软件工程任务(包括长程规划)、专业知识工作及金融领域基准测试中展现出较为均衡的综合能力。在Agents' Last Exam的CLI子集ALE-CLI、金融投资研究评测FrontierFinance,以及跨领域深度研究评测DRACO中,该模型表现仅次于GPT-6 Astra或Claude Opus 5。

目前,Step 5 Preview已全量开放,官方将于10月15日释放模型权重。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 3 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友