DeepSeek V4 Flash, 이제 Felo에서 제공 — Pro 구독자에게 7일간 무료
DeepSeek V4 Flash가 Felo에 출시되었습니다. 기존 Felo Pro 구독자는 8월 6일부터 7일간 무료로 이용할 수 있습니다 — Search, Codex/CC, Deep Research 모두 포함됩니다.

DeepSeek V4 Flash는 7월 31일에 프로덕션 릴리스를 출시했고, 그 성능은 많은 사람들을 놀라게 했습니다. 4월 프리뷰도 괜찮았지만, 이번 버전은 다릅니다. 에이전트 벤치마크가 크게 상승했고, DSpark의 추측 디코딩 덕분에 초당 60개 이상의 토큰 처리 속도를 기록했습니다. 그리고 오늘, 8월 6일부터 기존 Felo Pro 구독자는 V4 Flash를 7일간 무료로 이용할 수 있습니다 — Search, Codex, 그리고 프리미엄 툴킷 전체가 포함됩니다. 업그레이드나 추가 결제, 신용카드 필요 없이 바로 사용 가능합니다.
V4 Flash는 이미 시장에서 최고의 가격 대비 성능 모델이었습니다. 이제는 실제 엔지니어링 작업에서 플래그십 모델들과 어깨를 나란히 합니다. 무엇이 달라졌는지, 왜 중요한지, 그리고 이번 7일 무료 체험이 실제로 무엇을 제공하는지 소개합니다.
4월과 지금 사이에 달라진 점
V4 Flash는 V4 Pro의 축소판이 아닙니다. 완전히 다른 목표를 위해 설계되었습니다: 순수한 속도, 낮은 리소스 소모, 벤치마크 점수판이 아닌 실제 파이프라인에서의 활용성.
아키텍처는 Mixture of Experts 구조로 총 2840억 파라미터를 가지고 있으며, 토큰당 활성 파라미터는 130억에 불과합니다. 이는 DeepSeek V3의 활성 파라미터의 1/3도 안 됩니다. 그럼에도 불구하고 V3를 거의 모든 실용적 벤치마크에서 능가합니다. 차이는 하이브리드 어텐션 설계 — Compressed Sparse Attention(CSA)와 Heavily Compressed Attention(HCA)의 조합 — 덕분입니다. 이를 통해 V3가 100만 토큰 컨텍스트에서 소모하던 연산량의 10%만으로 동일한 작업을 수행합니다.
실제 의미는 다음과 같습니다: 100만 토큰 컨텍스트 윈도우가 단일 128GB 머신에서 구동됩니다. 75만 단어, 전체 코드베이스, 300페이지 분량의 법률 문서, 소설 3권 분량이 한 번에 처리됩니다. 쪼개기, 슬라이딩 윈도우, 꼼수 없이.
100만 컨텍스트에서 V4 Flash는 V3.2가 필요로 했던 KV 캐시 메모리의 약 7%만 사용합니다. 단순한 개선이 아니라 완전히 새로운 수준입니다.
DSpark도 중요한 요소입니다. 이는 추측 디코딩 모듈로, 후보 토큰을 병렬로 생성 및 검증하여 처리량을 두 배로 늘립니다. 결과적으로 일반 하드웨어에서 초당 60개 이상의 토큰을 생성합니다. 긴 에이전트 세션도 빌드 컴파일을 기다리는 느낌이 아니라 즉각적인 반응을 제공합니다.
모델은 요청마다 세 가지 추론 모드를 제공합니다:
| 모드 | 동작 | 사용 시점 |
|---|---|---|
| Non-Think | 빠르고 chain-of-thought 오버헤드 없음 | 빠른 조회, 번역, 초안 작성 |
| Think High | 명시적 단계별 추론 | 디버깅, 수학, 구조적 분석 |
| Think Max | 최대 추론 깊이 | 어려운 증명, 다단계 에이전트 워크플로우 |
이건 단순한 옵션이 아닙니다. 전체 프롬프트의 90%는 Non-Think로 처리하고, 정말 필요한 경우에만 Think Max로 전환하세요. 시간과 토큰을 절약하면서도 성능을 제한하지 않습니다.

실제로 중요한 벤치마크
4월 프리뷰는 준수한 성능을 보여줬습니다. 0731 프로덕션 릴리스는 에이전트 능력에 집중한 후훈련을 기반으로 구축되었습니다. 성능 향상은 확연합니다:
| 벤치마크 | 프리뷰 (4월) | 프로덕션 (0731) | V4 Pro (참고용) |
|---|---|---|---|
| SWE-bench Verified | — | 79.0% | 80.6% |
| Terminal Bench 2.1 | 61.8 | 82.7 | — |
| Cybergym | — | 76.7 | — |
| DeepSWE | 7.3 | 54.4 | — |
| GPQA Diamond | — | 71.2% | — |
| LiveCodeBench | — | 55.2% | 91.6% |
SWE-bench는 모두가 인용하는 벤치마크이며, 이번에는 그 집착이 정당합니다. 79.0%는 V4 Flash를 V4 Pro와 1.6점 차이로 만들며, V4 Pro는 활성 파라미터가 5배 이상 많습니다. 쿼리당 비용이 10~50배 더 비싼 시스템들과 같은 수준에 도달했습니다.
2840억 파라미터의 Flash가 1.6조 파라미터 Pro의 4월 프리뷰보다 에이전트 코딩에서 더 뛰어납니다. 여기서는 모델 크기가 아니라 후훈련이 대부분의 성능을 결정합니다.
솔직한 트레이드오프: V4 Flash는 여전히 Pro보다 순수 지식 회상이나 대회 수준 코딩 문제에서는 뒤처집니다. 하지만 대부분의 엔지니어가 실제로 하는 일 — PR 읽기, 파일 간 디버깅, 리팩토링, 테스트 작성 등 —에서는 차이가 거의 없습니다.
7일 무료 체험으로 실제로 열리는 기능
앞으로 7일간 V4 Flash는 Felo Pro 구독자에게 무료입니다. 그리고 Felo의 Pro는 단순한 모델 선택 기능 그 이상입니다.
V4 Flash 기반 Pro Search
Felo Search는 V4 Flash의 추론 능력과 실시간 웹 검색을 결합합니다. 자연어로 질문하세요. Felo는 다양한 언어의 소스를 모아 분석하고, 인라인 인용과 함께 직접적인 답변을 제공합니다. 링크 목록이나 SEO 쓰레기 없이, 클릭해서 검증할 수 있는 소스에 기반한 답변만 제공합니다.
Pro Search는 더 깊이 들어갑니다. 쿼리당 더 많은 소스를 가져오고, 더 긴 컨텍스트를 처리하며, 명확한 답변뿐 아니라 예외 케이스까지 다룹니다. Deep Research 모드는 단일 질문을 구조화된 다중 페이지 보고서로 만들어, 섹션 헤더와 인용 소스를 포함합니다. 직접 손으로 몇 시간 걸려 만들 보고서를 자동으로 생성합니다.
Codex 및 CC 통합
개발자에게 중요한 부분입니다. V4 Flash는 OpenAI의 Responses API를 네이티브로 지원하여 Codex CLI, ChatGPT Desktop, VS Code Codex 확장에 번역 레이어나 호환성 패치 없이 바로 연결됩니다. 설정에서 deepseek-v4-flash를 지정하면 최첨단 코딩 에이전트가 바로 실행됩니다.
7일 무료 기간 동안 Pro 구독자는 전체 기능을 사용할 수 있습니다: V4 Flash로 구동되는 에이전트 코딩, 툴 오케스트레이션, 다중 파일 편집, 전체 저장소를 쪼개지 않고 담을 수 있는 100만 토큰 컨텍스트 윈도우까지.

Pro 툴킷의 기타 기능
- 15,000 크레딧 즉시 지급, 매일 200 크레딧 추가
- 무제한 Pro 검색. 크레딧이 모두 소진되어도 하루 300회 Pro 검색 가능
- 파일 분석: PDF, CSV, 코드 파일 업로드 후 V4 Flash로 분석
- 슬라이드 생성: 검색 결과를 프레젠테이션으로 변환
- 마인드맵: 소스와 개념의 연결 시각화
- 다국어 통합: Felo는 영어, 중국어, 일본어, 한국어 소스를 읽고 원하는 언어로 통합
자동 갱신 없음. 무료 체험은 7일 후 종료되며, V4 Flash는 표준 Pro 요금제로 돌아갑니다.
무료 체험 신청 방법
3단계, 2분 이내 완료:
1단계: felo.ai에서 Felo Pro 계정에 로그인하세요. 이 혜택은 기존 Pro 구독자에게만 제공됩니다.
2단계: 오늘, 8월 6일부터 DeepSeek V4 Flash가 7일간 무료입니다. 대시보드에서 바로 이용 가능 — 코드 입력 필요 없음.
3단계: Felo Search를 열고 모델 드롭다운에서 DeepSeek V4 Flash를 선택한 후 Pro 검색을 실행하세요. 또는 playground.felo.ai에서 직접 채팅하거나 Codex 설정에서 deepseek-v4-flash를 지정하세요.
7일 무료 체험은 오늘, 8월 6일부터 시작됩니다. 승인 대기, 결제, 카드 등록 없이 바로 사용 가능합니다.

API 대신 Felo에서 V4 Flash를 사용하는 이유
DeepSeek의 API를 통해 V4 Flash를 직접 호출할 수 있습니다. 저렴합니다. 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28. 하지만 API만으로는 놓치는 부분이 많습니다.
실시간 정보 기반. V4 Flash는 텍스트 전용입니다. 웹 검색을 하지 않고, 학습 데이터도 제한적입니다. Felo는 실시간 검색을 추가하여 최신 정보에 기반한 추론을 제공합니다.
모델 비교 기능. Felo의 모델 선택기에는 GPT-5.5, Claude Opus 5, Gemini 3.6 Flash, V4 두 가지 버전이 포함되어 있습니다. 대화 중간에 모델을 변경할 수 있습니다. 빠른 작업에는 V4 Flash, 복잡한 논리에는 Opus로 전환하세요. 동일한 컨텍스트, 동일한 소스에서 비교 가능합니다.
검색 결과의 확장성. 결과를 LiveDoc으로 내보내거나, 주요 내용을 슬라이드로 생성하거나, 마인드맵으로 시각화할 수 있습니다. 무료 체험 기간 동안 전체 파이프라인을 사용할 수 있습니다.
기간 한정, 영구적이지 않음. 이번 무료 체험은 Felo Pro 구독자에게 7일간 제공됩니다. 종료 후 V4 Flash는 표준 Pro 요금제로 돌아갑니다. 일주일 동안 워크플로우에 적합한지 직접 확인해보세요.
Felo의 다른 모델과 V4 Flash 비교
Felo에서는 DeepSeek뿐 아니라 다양한 최첨단 모델을 사용할 수 있습니다. V4 Flash가 어디에 위치하는지, 언제 다른 모델을 선택할지 안내합니다.
V4 Flash vs GPT-5.5. GPT-5.5는 미묘한 글쓰기, 창의적 작업, 모호한 지시 처리에 강합니다. 하지만 API 기준 쿼리당 비용이 훨씬 높습니다. Felo에서는 둘 다 사용 가능하며, 코드 디버깅이나 빠른 검색에는 V4 Flash가 더 빠릅니다. 특정 톤이나 엄격한 형식의 글이 필요하다면 GPT-5.5가 더 안전한 선택입니다.
V4 Flash vs Claude Opus 5. Opus는 장문 작성, 책 분량의 문서에서 꼼꼼한 추론, 상세한 형식 지시를 따르는 데 강합니다. V4 Flash는 더 빠르고 저렴하며, 코드 작업에서는 충분히 근접한 성능을 보여 개발자들이 일상적으로 기본 선택으로 삼고 있습니다. Opus는 결과물이 정말 중요할 때 쓰는 정밀 도구로 생각하세요.
V4 Flash vs V4 Pro. Pro는 지식 집약적 작업, 대회 수준 수학, 가장 어려운 코딩 문제에 강합니다. Flash는 그 외 모든 작업에 더 뛰어나며, 속도가 빨라 모델을 기다린다는 느낌이 없습니다. 무료 체험 기간에는 둘 다 사용 가능합니다. 가장 어려운 문제에는 Pro, 나머지에는 Flash를 써보세요.
V4 Flash vs Gemini 3.6 Flash. 둘 다 빠른 속도와 큰 컨텍스트 윈도우를 가진 모델입니다. Gemini는 이미지, 비디오 등 멀티모달 입력을 지원합니다. V4 Flash는 텍스트 전용이지만 에이전트 코딩 벤치마크가 더 강하고 MIT 라이선스라는 장점이 있습니다. 비전이 필요하면 Gemini, 코드 작성과 편집이 필요하면 V4 Flash가 더 적합합니다.
FAQ
7일 무료 체험이 정말 무료인가요?
네 — 기존 Felo Pro 구독자에게 완전히 무료입니다. 신용카드, 자동 갱신 필요 없습니다. 오늘, 8월 6일부터 7일간 진행됩니다.
7일 체험 후에는 어떻게 되나요?
V4 Flash는 표준 Pro 요금제로 돌아갑니다. 다른 Pro 기능은 변함없습니다. 대화 기록, LiveDoc, 저장된 검색 모두 그대로 유지됩니다.
Codex 통합을 위해 별도 설치가 필요한가요?
아니요. V4 Flash는 Responses API를 네이티브로 지원합니다. Codex 설정에서 모델을 deepseek-v4-flash로 지정하면 Codex CLI, ChatGPT Desktop, VS Code 확장 모두에서 바로 작동합니다. 설정 한 번으로 전체 적용됩니다.
DeepSeek의 API를 직접 사용하는 것과 비교하면 어떤가요?
DeepSeek API는 저렴하고 빠릅니다. Felo는 실시간 웹 검색 기반, 다중 모델 비교, 문서/슬라이드/마인드맵 원클릭 내보내기 기능을 추가합니다. 순수 추론만 필요하다면 API를, 검색 기반 답변과 워크스페이스가 필요하다면 Felo가 더 적합합니다.
V4 Flash를 모바일에서 사용할 수 있나요?
네. Felo Search는 felo.ai에서 모든 모바일 브라우저에서 이용할 수 있습니다. playground.felo.ai의 LLM Playground도 모바일에 최적화되어 있습니다.
실제로 배포되는 첫 오픈 웨이트 모델
V4 Flash가 다른 오픈 웨이트 릴리스와 다른 점은 엔지니어링 팀들이 실험이나 대체재가 아닌, 실제 프로덕션 파이프라인의 주 모델로 사용하고 있다는 것입니다.
MIT 라이선스, Hugging Face에서 전체 웨이트 공개, 상업적 파인튜닝 허용. 그리고 0731 릴리스에서 에이전트 능력이 "가격 대비 충분히 좋다"에서 "충분히 좋다"로 넘어섰습니다. Felo의 7일 무료 체험은 Pro 구독자가 워크플로우에 적합한지 가장 쉽게 확인할 수 있는 방법입니다.
Felo Pro에 로그인하고 오늘부터 DeepSeek V4 Flash를 무료로 사용하세요 — 7일 무료 체험은 8월 12일에 종료됩니다.
이 글은 다음 언어로도 읽을 수 있습니다: English, 简体中文, 日本語, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, Español, বাংলা, Português.