Skip to main content

Grok 4.7 Kini Hadir di Felo Search: Jawaban Jangka Panjang, $2/$6

· 7 menit dibaca
Felo Search Tips Buddy
Committed to answers at your fingertips

Grok 4.7 sudah tersedia di Felo Search: konteks 500K, $2/$6 per juta token, dan penalaran jangka panjang untuk riset yang memakan waktu berjam-jam.

SpaceXAI merilis Grok 4.7 pada 21 September, dan model ini dirancang untuk tipe pertanyaan tertentu: pertanyaan yang membutuhkan waktu satu jam untuk menelusuri, bukan sekadar pencarian singkat. Model ini sudah tersedia di Felo Search, bersama tiga model lain yang juga hadir di minggu yang sama.

Angka utama terletak pada sisi output. Grok 4.7 berharga $2 per juta token input dan $6 per juta token output, sama dengan harga Grok 4.6, sementara vendor mengklaim kecepatan dua kali lipat dari model sekelasnya. Jawaban pencarian di Felo bukan satu kali panggilan model. Model membaca sumber, membandingkan satu sama lain, menulis sintesis, dan kembali lagi jika ada ketidaksesuaian. Harga output mencerminkan biaya investigasi panjang.

Grok 4.7 in Felo Search: a 500K-token context window over a long-horizon research task

Apa Itu Grok 4.7​

SpaceXAI (perusahaan yang sebelumnya bernama xAI) memposisikan Grok 4.7 sebagai "model terkuat untuk pemrograman dan kerja pengetahuan." Bagian menarik dari deskripsi ini terletak pada bagian kedua. Pemrograman menjadi fokus tiga rilis Grok sebelumnya; model ini dilatih dengan reinforcement learning lebih lama, dengan bobot pada tugas yang membutuhkan beberapa jam untuk diselesaikan.

Pelatihan tersebut terlihat pada dua aspek yang terasa dari kotak pencarian: verifikasi mandiri dan manajemen konteks panjang. Model ini terlatih untuk memeriksa hasil kerja menengahnya sendiri, bukan langsung memilih jalur pertama yang terlihat masuk akal, dan tetap melacak apa yang sudah ditetapkan dua puluh langkah sebelumnya.

SpecGrok 4.7
Model IDgrok-4.7
MakerSpaceXAI
ReleasedSeptember 21, 2026
Context window500,000 tokens
InputText, image
OutputText
Reasoning effortlow / medium / high (default) / xhigh
Price$2 per juta input, $6 per juta output
Cached input$0.50 per juta token
Knowledge cutoffJuni 2026, dengan pelatihan tambahan hingga Agustus 2026

Jendela konteks 500.000 token menjadi yang paling kecil dari empat model yang hadir minggu ini. Namun, ukuran ini sudah cukup untuk tugas pencarian: seratus dokumen panjang, satu kuartal penuh laporan keuangan, atau satu rangkaian riset dengan semua sumber tetap dalam konteks. Jendela lebih besar dibutuhkan saat model harus menampung satu repositori atau satu tahun dokumentasi tanpa proses retrieval di antaranya. Kondisi tersebut berlaku untuk model 1M-token pada tabel di bawah.

Mengapa Ini Penting untuk Pencarian AI​

Jawaban pencarian memiliki dua kegagalan. Pertama, tidak menemukan sumber. Kedua, menemukan sumber, salah membaca, dan menyampaikan kesalahan itu dengan yakin. Kegagalan kedua lebih berbahaya, karena tampilannya sama seperti jawaban benar.

Pelatihan jangka panjang menargetkan kegagalan kedua. Ketika model diberi penghargaan untuk menyelesaikan tugas berjam-jam dengan benar, strategi murah tidak lagi berhasil. Mencocokkan pola pada dokumen pertama yang terlihat masuk akal, mengabaikan sumber yang bertentangan dengan jawaban yang mulai terbentuk, atau melupakan batasan yang sudah ditetapkan di awal: semua itu tidak bertahan pada tugas yang berjalan selama berjam-jam. Kebiasaan yang bertahan dari pelatihan ini adalah kembali dan memeriksa ulang.

Skor yang dipublikasikan Grok 4.7 juga mengarah ke sana. Pada GDPval, yang mengukur kualitas hasil kerja profesional di dunia nyata, vendor melaporkan Elo 1.695, naik dari 1.605 untuk Grok 4.6. Pada AA Briefcase v1.1, tolok ukur kerja pengetahuan, model ini naik dari 1.546 ke 1.657. HealthBench Professional naik dari 48,5% ke 56,7%, dan Harvey Legal Agent Benchmark dari 15,8% ke 19,6%.

Angka-angka tersebut berasal dari vendor, dievaluasi pada pengaturan dan alat yang berbeda, jadi perlakukan sebagai klaim, bukan hasil. Perbandingan yang layak dipercaya adalah dalam keluarga yang sama: 4.7 mengungguli 4.6, konsisten, pada pekerjaan yang mirip riset.

1. Buka pemilih model. Mulai pencarian di Felo dan pilih Grok 4.7. Tidak ada perubahan pada alur kerja: kotak yang sama, sumber yang sama, workspace yang sama.

2. Ajukan pertanyaan yang biasanya dipecah jadi empat. Model jangka panjang memberikan nilai pada permintaan ambigu dengan banyak batasan. Alih-alih "apa garis waktu EU AI Act" coba "kewajiban EU AI Act mana yang berlaku lebih dulu untuk perusahaan yang menjual model general-purpose ke UE, dan mana yang sudah memiliki panduan implementasi." Satu prompt, beberapa sub-pertanyaan.

3. Biarkan model berbeda pendapat dengan dirinya sendiri. Lanjutkan dengan "di mana sumber Anda saling bertentangan, dan mana yang lebih otoritatif?" Model yang terlatih untuk verifikasi mandiri menangani tantangan ini lebih baik daripada model yang hanya menghasilkan satu jawaban yakin.

4. Ubah tingkat usaha saat bentuk pertanyaan berubah. Grok 4.7 menyediakan empat pengaturan tingkat penalaran. Medium cocok untuk riset biasa; naikkan jika pertanyaan memiliki rantai dependensi panjang, dan turunkan jika hanya meringkas sesuatu yang sudah dipercaya.

5. Dorong jawaban ke depan. Jendela konteks yang sama menampung riset dan hasil akhirnya. Minta memo, outline presentasi, atau email. Sumber masih ada di depan model.

Grok 4.7 tidak datang sendirian. Empat model frontier dirilis dalam waktu sekitar tiga puluh enam jam, dan semuanya kini berjalan di Felo Search.

ModelDirilis olehHarga per juta tokenKonteksDibuat untuk
Grok 4.7SpaceXAI$2 in / $6 out500KPenalaran jangka panjang dan kerja pengetahuan
Claude Opus 5.5Anthropic$4 in / $20 out1MJawaban yang lolos verifikasi
GPT-6 LunaOpenAI$0.10 in / $0.50 out1.05MPencarian volume tinggi dengan biaya terendah per panggilan
GPT-6 SolOpenAI$2 in / $10 out1.05MAgent loop dan panggilan berulang dengan harga menengah

Perbedaan harga di antara model-model ini sekitar dua puluh kali pada harga input dan lima puluh kali pada biaya investigasi penuh. Memilih model per pertanyaan kini menjadi pengungkit terbesar untuk kualitas jawaban dan jumlah riset yang bisa dijalankan.

Apa yang Dicoba Pertama Kali​

Pertanyaan dengan jawaban yang diperdebatkan. Tanyakan sesuatu yang sumber seriusnya saling bertentangan: efektivitas suplemen, biaya migrasi sebenarnya, estimasi ukuran pasar. Lalu minta Grok 4.7 memisahkan apa yang disepakati sumber dari klaim tunggal. Inilah bentuk tugas yang ditargetkan pelatihan jangka panjang.

Dokumen yang perlu diperdebatkan. Tempel kontrak, kebijakan, atau spesifikasi dan tanyakan apa yang tidak dicakup. Pertanyaan tentang ketiadaan bukti menjadi titik lemah model yang berhenti pada pembacaan pertama yang masuk akal.

Rekonsiliasi antar sumber. Berikan dua laporan dari perusahaan pesaing dan minta perbandingan seperti yang dilakukan analis, beserta angka yang sengaja dihindari masing-masing.

Perkiraan dengan batasan. Model jangka panjang menangani "ini delapan batasan, temukan rencana yang memenuhi semuanya" lebih baik daripada brainstorming terbuka.

Grok 4.7 sudah tersedia di Felo Search hari ini, dengan jendela konteks 500.000 token, empat pengaturan tingkat penalaran, dan harga $2/$6. Harganya sama dengan model yang digantikannya, sehingga peningkatan ini gratis di tingkat token.

Open Grok 4.7 in Felo Search →


Tulisan ini juga tersedia dalam English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, Español, বাংলা and Português.