Grok 4.7现已加入Felo Search:长周期答案,$2/$6
Grok 4.7已上线Felo Search:50万上下文,百万令牌$2/$6,专为耗时数小时的研究打造长周期推理。
SpaceXAI于9月21日发布了Grok 4.7,这款模型针对一种特殊类型的问题:需要花费一小时深入挖掘,而不是简单查找。现在它已在Felo Search上线,与同周发布的另外三款模型共同提供服务。
价格重点在输出端。Grok 4.7的费用为每百万输入令牌$2,每百万输出令牌$6,与Grok 4.6价格相同,厂商宣称速度是同类模型的两倍。在Felo中,一次搜索答案并非一次模型调用。它会读取来源,互相校验,撰写综合内容,并在发现不一致时回溯。输出价格反映了长时间调查的实际消耗。

Grok 4.7是什么
SpaceXAI(前身为xAI)将Grok 4.7定位为其“最强大的编码与知识工作模型”。描述中有趣的部分在后半句。前三代Grok主要聚焦编码;这一次,模型经过更长时间的强化学习,重点训练需要数小时完成的任务。
这种训练体现在搜索体验的两个方面:自我验证和长上下文管理。模型学会检查自己的中间结果,而不是直接采用第一个看似合理的路径,并能记住二十步前建立的事实。
| 规格 | Grok 4.7 |
|---|---|
| 模型ID | grok-4.7 |
| 厂商 | SpaceXAI |
| 发布日期 | 2026年9月21日 |
| 上下文窗口 | 500,000令牌 |
| 输入 | 文本,图片 |
| 输出 | 文本 |
| 推理强度 | 低 / 中 / 高(默认)/ 极高 |
| 价格 | 每百万输入$2,输出$6 |
| 缓存输入 | 每百万令牌$0.50 |
| 知识截止 | 2026年6月,补充训练至2026年8月 |
本周上线的四款模型中,50万令牌窗口是最小的。但对于搜索任务来说,这已足够:可容纳百份长文档、一季度财报或完整研究线索,所有来源都在上下文中。更大窗口适用于需要模型直接持有代码库或全年文档,无需检索步骤。下表中的百万令牌模型适合这种场景。
这对AI搜索意味着什么
搜索答案有两种失败方式。第一种是找不到来源。第二种是找到来源,误读内容,并自信地陈述错误。第二种更危险,因为它看起来就像正确答案。
长周期训练针对第二种失败。模型在完成多小时任务时获得奖励,低成本策略无法奏效。仅匹配第一个看似合理文档、忽略与答案矛盾的来源、丢弃早期建立的约束:这些方法在长时间任务中无法存活。训练后,模型养成回溯和核查的习惯。
Grok 4.7的公开分数也指向这一点。在GDPval(衡量真实专业交付质量)上,厂商报告Elo为1695,Grok 4.6为1605。在AA Briefcase v1.1知识工作基准上,分数从1546提升到1657。HealthBench Professional从48.5%升至56.7%,Harvey Legal Agent Benchmark从15.8%升至19.6%。
这些数据由厂商报告,评估时采用不同强度和工具,因此应视为声明而非结果。值得信赖的比较是同系列内部:4.7在类似研究任务上持续优于4.6。
如何在Felo Search使用Grok 4.7
1. 打开模型选择器。 在Felo发起搜索,选择Grok 4.7。其他操作不变:同样的输入框、来源和工作空间。
2. 提出通常需要拆分成四个的问题。 长周期模型在模糊、多约束请求中展现价值。例如,不要只问“欧盟AI法案时间线”,而是问“对于向欧盟销售通用模型的公司,哪些AI法案义务最先生效,哪些已有实施指南发布?”一个提示,多个子问题。
3. 允许模型自我矛盾。 继续追问“你的来源在此有何冲突,哪个更权威?”经过自我验证训练的模型比只追求自信答案的模型处理得更好。
4. 问题形态变化时切换推理强度。 Grok 4.7提供四种推理强度。中等适合普通研究;依赖链较长时提高,已信任内容总结时降低。
5. 推进答案。 同一上下文窗口可容纳研究与交付成果。可要求生成备忘录、演示文稿大纲或邮件,源材料仍在模型面前。
Felo Search中的其他三款模型
Grok 4.7并非孤身到来。约36小时内,四款前沿模型陆续发布,现均可在Felo Search运行。
| 模型 | 发布方 | 每百万令牌价格 | 上下文 | 适用场景 |
|---|---|---|---|---|
| Grok 4.7 | SpaceXAI | 输入$2 / 输出$6 | 50万 | 长周期推理与知识工作 |
| Claude Opus 5.5 | Anthropic | 输入$4 / 输出$20 | 100万 | 经验证的答案 |
| GPT-6 Luna | OpenAI | 输入$0.10 / 输出$0.50 | 105万 | 最低成本高容量搜索 |
| GPT-6 Sol | OpenAI | 输入$2 / 输出$10 | 105万 | 中档价格的代理循环与重复调用 |
它们之间的输入价格相差约20倍,完整调查的成本相差约50倍。按问题选择模型,成为影响答案质量和可承受研究量的最大杠杆。
首次尝试建议
有争议答案的问题。 提问时选择严肃来源存在分歧的话题,如某种补剂效果、迁移实际成本、市场规模估算。然后让Grok 4.7区分来源共识与单方观点。这正是长周期训练针对的任务类型。
需要辩驳的文档。 粘贴合同、政策或规范,询问其未涵盖内容。证据缺失类问题,模型若只停留在第一个合理解读时,最容易悄然出错。
跨来源对比。 提供两家竞争公司文件,要求模型给出分析师会做的对比,并指出各自回避的数字。
带约束的预测。 长周期模型在“给出八个约束,找出全部满足的方案”这类任务上表现优于开放式头脑风暴。
在Felo Search体验Grok 4.7
Grok 4.7今日已上线Felo Search,拥有50万令牌上下文窗口、四档推理强度和$2/$6定价。其费用与前代相同,意味着升级在令牌层面免费。
本文还提供以下语言版本:English、日本語、한국어、繁體中文、हिन्दी、Français、العربية、Русский、اردو、Bahasa Indonesia、Deutsch、Tiếng Việt、Türkçe、Italiano、ไทย、Español、বাংলা、Português。