Skip to main content

Grok 4.7 è ora in Felo Search: Risposte a lungo termine, $2/$6

· 8 minuti di lettura
Felo Search Tips Buddy
Committed to answers at your fingertips

Grok 4.7 è attivo in Felo Search: 500K di contesto, $2/$6 per milione di token e ragionamento a lungo termine pensato per ricerche che richiedono ore.

SpaceXAI ha rilasciato Grok 4.7 il 21 settembre, progettato per un tipo specifico di domanda: quella che richiede un’ora di approfondimento invece di una semplice ricerca. Ora è disponibile in Felo Search, insieme ad altri tre modelli arrivati nella stessa settimana.

Il dato principale riguarda l’output. Grok 4.7 costa $2 per milione di token in input e $6 per milione di token in output, lo stesso prezzo di Grok 4.6, mentre il fornitore dichiara il doppio della velocità rispetto ai modelli simili. Una risposta di ricerca in Felo non corrisponde a una sola chiamata al modello. Legge le fonti, le confronta tra loro, scrive la sintesi e torna indietro quando trova discrepanze. Il prezzo dell’output riflette il costo reale di un’indagine approfondita.

Grok 4.7 in Felo Search: a 500K-token context window over a long-horizon research task

Cos’è davvero Grok 4.7​

SpaceXAI (precedentemente xAI) presenta Grok 4.7 come il suo "modello più potente per il coding e il lavoro di conoscenza." La parte interessante di questa descrizione riguarda il lavoro di conoscenza. Le versioni precedenti di Grok si sono concentrate sul coding; questa versione ha ricevuto un addestramento con una fase di reinforcement learning più lunga, orientata verso compiti che richiedono diverse ore per essere completati.

Questo addestramento si manifesta in due aspetti percepibili dalla ricerca: autoverifica e gestione del lungo contesto. Il modello è stato addestrato a controllare il proprio lavoro intermedio invece di fermarsi alla prima soluzione plausibile, e a ricordare ciò che ha stabilito venti passaggi prima.

SpecGrok 4.7
Model IDgrok-4.7
MakerSpaceXAI
Released21 settembre 2026
Context window500.000 token
InputTesto, immagine
OutputTesto
Reasoning effortbasso / medio / alto (predefinito) / molto alto
Price$2 per milione in input, $6 per milione in output
Cached input$0.50 per milione di token
Knowledge cutoffgiugno 2026, con addestramento supplementare fino ad agosto 2026

La finestra di 500.000 token è la più piccola tra i quattro modelli arrivati questa settimana. Per una ricerca, però, risulta più che sufficiente: cento documenti lunghi, un intero trimestre di bilanci, o una discussione di ricerca completa con tutte le fonti ancora nel contesto. Le finestre più grandi servono quando si vuole che il modello gestisca un repository o un anno di documentazione senza passaggi intermedi di recupero. Questo vale per i modelli da 1M token nella tabella qui sotto.

Perché conta per la ricerca AI​

Una risposta di ricerca può fallire in due modi. Il primo: non trova la fonte. Il secondo: trova la fonte, la interpreta male e presenta l’errore con sicurezza. Il secondo caso risulta più grave, perché appare identico a una risposta corretta.

L’addestramento a lungo termine affronta il secondo problema. Quando un modello riceve una ricompensa per completare correttamente compiti di più ore, le strategie rapide non funzionano più. Riconoscere uno schema nel primo documento plausibile, ignorare una fonte che contraddice la risposta in costruzione, dimenticare un vincolo stabilito all’inizio: nessuna di queste strategie regge in un compito che dura ore. L’abitudine che resta dopo quell’addestramento è quella di tornare indietro e verificare.

I punteggi pubblicati di Grok 4.7 vanno nella stessa direzione. Su GDPval, che misura la qualità reale di un deliverable professionale, il fornitore riporta un Elo di 1.695, rispetto a 1.605 di Grok 4.6. Su AA Briefcase v1.1, un benchmark per il lavoro di conoscenza, passa da 1.546 a 1.657. HealthBench Professional sale dal 48,5% al 56,7%, e il Harvey Legal Agent Benchmark dal 15,8% al 19,6%.

Questi dati provengono dal fornitore, valutati con diversi livelli di sforzo e strumenti, quindi vanno considerati come una dichiarazione e non come un risultato. Il confronto più affidabile resta quello all’interno della stessa famiglia: 4.7 supera 4.6, in modo costante, nei compiti simili alla ricerca.

1. Apri il selettore del modello. Avvia una ricerca in Felo e scegli Grok 4.7. Nessun altro aspetto del flusso di lavoro cambia: stessa casella, stesse fonti, stesso spazio di lavoro.

2. Fai la domanda che normalmente divideresti in quattro. I modelli a lungo termine valgono il prezzo su richieste ambigue e con più vincoli. Invece di "qual è la timeline dell’AI Act UE" prova con "quali obblighi dell’AI Act UE si applicano prima a un’azienda che vende un modello generalista nell’UE, e quali di questi hanno già linee guida attuative pubblicate." Un prompt, più sotto-domande.

3. Lascialo contraddirsi. Continua con "dove le tue fonti sono in conflitto su questo punto, e quale risulta più autorevole?" Un modello addestrato sull’autoverifica gestisce meglio questa sfida rispetto a uno addestrato a produrre una risposta unica e sicura.

4. Cambia il livello di sforzo quando la domanda cambia forma. Grok 4.7 offre quattro livelli di sforzo nel ragionamento. Il livello medio copre la ricerca ordinaria; alzalo quando la domanda presenta una lunga catena di dipendenze, abbassalo quando devi solo riassumere qualcosa di già affidabile.

5. Porta avanti la risposta. La stessa finestra di contesto contiene sia la ricerca sia il deliverable. Chiedi il memo, la scaletta della presentazione o l’email. Il materiale di partenza resta visibile.

Grok 4.7 non è arrivato da solo. Quattro modelli di frontiera sono stati rilasciati nell’arco di circa trentasei ore, e ora tutti e quattro funzionano in Felo Search.

ModelReleased byPrice per million tokensContextBuilt for
Grok 4.7SpaceXAI$2 in / $6 out500KRagionamento a lungo termine e lavoro di conoscenza
Claude Opus 5.5Anthropic$4 in / $20 out1MRisposte che superano la verifica
GPT-6 LunaOpenAI$0.10 in / $0.50 out1.05MRicerca ad alto volume al costo più basso per chiamata
GPT-6 SolOpenAI$2 in / $10 out1.05MLoop agent e chiamate ripetute a prezzo intermedio

La differenza tra loro si aggira intorno a venti volte sul prezzo di input e cinquanta volte sul costo di un’indagine completa. La scelta per domanda rappresenta ora la leva principale sia sulla qualità della risposta sia sulla quantità di ricerca sostenibile.

Cosa provare per primo​

Una domanda con risposta contestata. Chiedi qualcosa su cui fonti autorevoli non concordano: l’efficacia di un integratore, il costo reale di una migrazione, una stima di mercato. Poi chiedi a Grok 4.7 di separare ciò su cui le fonti concordano da ciò che sostiene solo una di esse. Questo è il tipo di compito per cui l’addestramento a lungo termine risulta più efficace.

Un documento con cui devi discutere. Incolla un contratto, una policy o una specifica e chiedi cosa non copre. Le domande sull’assenza di evidenza sono quelle in cui un modello che si ferma alla prima lettura plausibile fallisce in modo più silenzioso.

Una riconciliazione tra fonti. Fornisci due bilanci di aziende concorrenti e chiedi il confronto che farebbe un analista, con il dato che ognuna evita di evidenziare.

Una previsione con vincoli. I modelli a lungo termine gestiscono meglio "ecco otto vincoli, trova il piano che li soddisfa tutti" rispetto al brainstorming aperto.

Grok 4.7 è attivo in Felo Search oggi, con una finestra di contesto da 500.000 token, quattro livelli di sforzo nel ragionamento e prezzi $2/$6. Costa quanto il modello che sostituisce, quindi l’upgrade risulta gratuito a livello di token.

Apri Grok 4.7 in Felo Search →


Questo articolo è disponibile anche in English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, ไทย, Español, বাংলা and Português.