SpaceXAI发布Grok 4.7 主打编程与知识工作
驱动中国9月22日消息,SpaceXAI推出Grok 4.7大模型,面向编程和知识工作,官方称采用更大基础模型并延长强化学习训练,在多项基准中较Grok 4.6提升,已通过Cursor、Grok Build及Grok API提供。
驱动中国9月22日消息,SpaceXAI推出新一代模型Grok 4.7,面向编程和知识工作场景。官方将其描述为该公司当前编码和知识处理模型中表现领先的版本,并公布训练、基准、安全、访问方式和价格等信息。
官方称,Grok 4.7采用规模更大的基础模型,并通过更长时间强化学习训练提升复杂任务处理能力。与Grok 4.6相比,新模型能够在困难任务上持续更长时间,同时加强对自身输出结果的检查能力。训练数据更加侧重需要数小时完成的复杂任务,并针对自我验证和长上下文管理进行优化。
在性能与成本表述上,官方称Grok 4.7运行速度达到同类模型的两倍,价格仅为同类模型的一半。针对CursorBench 4.0测试,该模型面向长时间运行的编程任务,在价格与性能方面处于同类模型前列。官方同时表示,其运行速度和定价与Grok 4.6相同。
官方称,Grok 4.7针对编程和知识工作进行了优化。该模型还针对Grok Bot harness进行原生训练,以提升对话和一般知识工作任务中的表现。文档和演示文稿生成能力也有所改进。
在GDPval和AA Briefcase两项基准测试中,Grok 4.7较Grok 4.6有所提升。相关测试要求AI完成律师、护士、金融分析师等专业人士日常工作中的任务。官方称,Grok 4.7在这两项测试中的表现已达到与其他前沿模型相近的水平。
安全方面,SpaceXAI为Grok 4.7采用新的安全防护体系。官方称,该模型在拒答和抵抗越狱攻击方面处于公司目前测试中的前列。在网络安全和生物领域等具有双重用途的场景中,Grok 4.7兼顾合法任务可用性与危险任务安全拒答。
在LatchBio生物安全基准测试中,Grok 4.7取得62.4%的成绩。针对网络安全场景,官方称该模型在HackerBench v0.3测试中仅允许3.3%的高风险双重用途提示通过,同时较少阻止合法安全工作。SpaceXAI已开始向部分网络安全合作伙伴提供邀请制访问权限,用于红队能力和防御研究。
目前,Grok 4.7已通过Cursor和Grok Build提供,并开放Grok API,支持第三方编程工具、模型路由服务及云平台。
价格方面,Grok 4.7每百万词元输入起价为2美元,按现汇率约合人民币13.4元;输出起价为6美元,按现汇率约合人民币40.2元。SpaceXAI同时提供高速版本,输出速度翻倍,价格也翻倍。