Skip to main content

Grok 4.7现已加入Felo Search:长周期答案,$2/$6

· 阅读需 7 分钟
Felo Search Tips Buddy
Committed to answers at your fingertips

Grok 4.7已上线Felo Search:50万上下文,百万令牌$2/$6,专为耗时数小时的研究打造长周期推理。

SpaceXAI于9月21日发布了Grok 4.7,这款模型针对一种特殊类型的问题:需要花费一小时深入挖掘,而不是简单查找。现在它已在Felo Search上线,与同周发布的另外三款模型共同提供服务。

价格重点在输出端。Grok 4.7的费用为每百万输入令牌$2,每百万输出令牌$6,与Grok 4.6价格相同,厂商宣称速度是同类模型的两倍。在Felo中,一次搜索答案并非一次模型调用。它会读取来源,互相校验,撰写综合内容,并在发现不一致时回溯。输出价格反映了长时间调查的实际消耗。

Grok 4.7 in Felo Search: a 500K-token context window over a long-horizon research task

Grok 4.7是什么​

SpaceXAI(前身为xAI)将Grok 4.7定位为其“最强大的编码与知识工作模型”。描述中有趣的部分在后半句。前三代Grok主要聚焦编码;这一次,模型经过更长时间的强化学习,重点训练需要数小时完成的任务。

这种训练体现在搜索体验的两个方面:自我验证和长上下文管理。模型学会检查自己的中间结果,而不是直接采用第一个看似合理的路径,并能记住二十步前建立的事实。

规格Grok 4.7
模型IDgrok-4.7
厂商SpaceXAI
发布日期2026年9月21日
上下文窗口500,000令牌
输入文本,图片
输出文本
推理强度低 / 中 / 高(默认)/ 极高
价格每百万输入$2,输出$6
缓存输入每百万令牌$0.50
知识截止2026年6月,补充训练至2026年8月

本周上线的四款模型中,50万令牌窗口是最小的。但对于搜索任务来说,这已足够:可容纳百份长文档、一季度财报或完整研究线索,所有来源都在上下文中。更大窗口适用于需要模型直接持有代码库或全年文档,无需检索步骤。下表中的百万令牌模型适合这种场景。

这对AI搜索意味着什么​

搜索答案有两种失败方式。第一种是找不到来源。第二种是找到来源,误读内容,并自信地陈述错误。第二种更危险,因为它看起来就像正确答案。

长周期训练针对第二种失败。模型在完成多小时任务时获得奖励,低成本策略无法奏效。仅匹配第一个看似合理文档、忽略与答案矛盾的来源、丢弃早期建立的约束:这些方法在长时间任务中无法存活。训练后,模型养成回溯和核查的习惯。

Grok 4.7的公开分数也指向这一点。在GDPval(衡量真实专业交付质量)上,厂商报告Elo为1695,Grok 4.6为1605。在AA Briefcase v1.1知识工作基准上,分数从1546提升到1657。HealthBench Professional从48.5%升至56.7%,Harvey Legal Agent Benchmark从15.8%升至19.6%。

这些数据由厂商报告,评估时采用不同强度和工具,因此应视为声明而非结果。值得信赖的比较是同系列内部:4.7在类似研究任务上持续优于4.6。

如何在Felo Search使用Grok 4.7​

1. 打开模型选择器。 在Felo发起搜索,选择Grok 4.7。其他操作不变:同样的输入框、来源和工作空间。

2. 提出通常需要拆分成四个的问题。 长周期模型在模糊、多约束请求中展现价值。例如,不要只问“欧盟AI法案时间线”,而是问“对于向欧盟销售通用模型的公司,哪些AI法案义务最先生效,哪些已有实施指南发布?”一个提示,多个子问题。

3. 允许模型自我矛盾。 继续追问“你的来源在此有何冲突,哪个更权威?”经过自我验证训练的模型比只追求自信答案的模型处理得更好。

4. 问题形态变化时切换推理强度。 Grok 4.7提供四种推理强度。中等适合普通研究;依赖链较长时提高,已信任内容总结时降低。

5. 推进答案。 同一上下文窗口可容纳研究与交付成果。可要求生成备忘录、演示文稿大纲或邮件,源材料仍在模型面前。

Felo Search中的其他三款模型​

Grok 4.7并非孤身到来。约36小时内,四款前沿模型陆续发布,现均可在Felo Search运行。

模型发布方每百万令牌价格上下文适用场景
Grok 4.7SpaceXAI输入$2 / 输出$650万长周期推理与知识工作
Claude Opus 5.5Anthropic输入$4 / 输出$20100万经验证的答案
GPT-6 LunaOpenAI输入$0.10 / 输出$0.50105万最低成本高容量搜索
GPT-6 SolOpenAI输入$2 / 输出$10105万中档价格的代理循环与重复调用

它们之间的输入价格相差约20倍,完整调查的成本相差约50倍。按问题选择模型,成为影响答案质量和可承受研究量的最大杠杆。

首次尝试建议​

有争议答案的问题。 提问时选择严肃来源存在分歧的话题,如某种补剂效果、迁移实际成本、市场规模估算。然后让Grok 4.7区分来源共识与单方观点。这正是长周期训练针对的任务类型。

需要辩驳的文档。 粘贴合同、政策或规范,询问其未涵盖内容。证据缺失类问题,模型若只停留在第一个合理解读时,最容易悄然出错。

跨来源对比。 提供两家竞争公司文件,要求模型给出分析师会做的对比,并指出各自回避的数字。

带约束的预测。 长周期模型在“给出八个约束,找出全部满足的方案”这类任务上表现优于开放式头脑风暴。

在Felo Search体验Grok 4.7​

Grok 4.7今日已上线Felo Search,拥有50万令牌上下文窗口、四档推理强度和$2/$6定价。其费用与前代相同,意味着升级在令牌层面免费。

打开Grok 4.7体验Felo Search →


本文还提供以下语言版本:English、日本語、한국어、繁體中文、हिन्दी、Français、العربية、Русский、اردو、Bahasa Indonesia、Deutsch、Tiếng Việt、Türkçe、Italiano、ไทย、Español、বাংলা、Português。