SpaceXAI发布Grok 4.6旗舰模型
2026-08-13 15:52
收藏

维度网讯,8月12日,美国人工智能企业SpaceXAI发布新一代旗舰模型Grok 4.6,重点提升长周期智能体、软件开发、知识工作及交互式应用构建能力。该模型已经通过Grok Build、Cursor和SpaceXAI API上线,并接入OpenRouter、Vercel及Cloudflare等合作平台。

Grok 4.6支持文本和图像输入、文本输出,上下文窗口为50万Token,可调用函数、网络搜索、X平台搜索及代码执行工具,并支持结构化输出。开发者可以通过Responses API和Chat Completions接口调用模型,推理强度可设置为低、中、高和超高四档,默认采用高推理模式。

SpaceXAI表示,Grok 4.6主要面向需要连续执行多个步骤的复杂任务,包括跨来源研究、信息分析、大型代码库处理、软件原型开发以及工作成果生成。与Grok 4.5相比,新模型在长任务中会进行更多自我测试和结果验证,并强化了从产品构想到交互式应用初始版本的生成能力。

在训练方面,Grok 4.6采用了比上一代更长的补充训练过程,数据包括用于推理和高级技术概念的模型生成数据以及工程数据。SpaceXAI随后利用Grok 4.5重新生成覆盖不同推理强度、智能体框架、科学、工程、数学和软件开发领域的监督微调轨迹,并通过模型检查过滤存在问题的训练记录。模型还接受了知识工作、通用编程、内核优化、网页开发和计算机辅助设计等智能体任务的强化学习训练。

根据SpaceXAI公布的数据,Grok 4.6在Artificial Analysis Intelligence Index综合测试中获得61分,比Grok 4.5的56分提高5分,与GPT-5.6 Sol持平,较Claude Fable 5低1分。该指数综合了科学、编程和金融服务等九项测试,但测试成绩主要反映特定条件下的模型表现,不能直接等同于所有实际业务场景中的能力。

在智能体及软件开发测试中,Grok 4.6在CursorBench 3.2中取得69.9%,在DeepSWE 1.1中取得65.9%,在FrontierCode 1.1扩展测试中取得61.3%。其APEX-Agents成绩为57.5%,高于Grok 4.5的47.1%;在评估复杂知识工作能力的AA-Briefcase测试中获得1577分,也高于上一代的1313分。

Grok 4.6标准版API基础价格为每百万输入Token 2美元、每百万缓存输入Token 0.5美元、每百万输出Token 6美元。当输入上下文超过20万Token时,官方将采用更高费率;SpaceXAI还提供速度更快、价格约为标准版两倍的版本。Grok Build和Cursor在模型发布首周提供两倍用量额度。

SpaceXAI称,新模型已完成该公司迄今覆盖范围最广的部署前能力与安全测试,并将继续开展部署后及第三方测试。不过,官方公布的多数性能数据来自企业自身测试或引用其他模型开发商公开结果,仍需通过独立评测和企业实际部署进一步验证。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com