
Google, Gemini 3.6 Flash 등 3 종 모델 발표: Token 비용 17% 절감, 속도 2 배 빠름
저자: Google DeepMind
번역: TechFlow
TechFlow 가이드:Google 이 이번에 출시한 세 가지 모델의 핵심은 AI 에이전트 상업화의 실제 페인 포인트인 비용과 속도를 해결하는 것입니다. 3.6 Flash 는 이전 세대보다 토큰을 17% 절감하며 가격은 더 낮지만 품질은 더 좋고; 3.5 Flash-Lite 는 속도가 초당 350 토큰에 달해 현재 가장 빠른 3.5 시리즈 모델이며; 전용 사이버 보안 모델인 Flash Cyber 는 코드 취약점 수정이라는 필수 수요 시장을 목표로 합니다. 이것은 성능 벤치마크 게임이 아니라 대규모 AI 에이전트 배포를 위한 기반을 마련하는 것입니다.
Google DeepMind 는 오늘 세 가지 새로운 Gemini 모델인 3.6 Flash, 3.5 Flash-Lite 및 3.5 Flash Cyber 를 출시했습니다. 이 모델들은 대규모 AI 에이전트 구축에 필요한 효율성, 지연 시간 및 신뢰성을 위해 설계되었습니다.
Gemini 3.6 Flash: 더 효율적이고 더 높은 품질
3.6 Flash 는 개발자들의 3.5 Flash 에 대한 피드백을 바탕으로 직접 개선되었습니다. 이는 코딩 및 지식 작업에서 한층 더 발전했을 뿐만 아니라 토큰 효율성도 크게 향상되었습니다. Artificial Analysis Index 에 따르면 3.6 Flash 는 3.5 Flash 보다 출력 토큰 소모를 17% 줄였습니다. Datacurve 의 DeepSWE 와 같은 일부 벤치마크에서는 감소 폭이 최대 65% 에 달했습니다. 다단계 워크플로우 완성에 필요한 추론 단계와 도구 호출도 더 적습니다.
이러한 효율성 향상은 더 낮은 가격과 함께 제공됩니다. 입력 토큰 백만 개당 1.5 달러, 출력 토큰 백만 개당 7.5 달러의 가격으로 3.6 Flash 는 에이전트 작업당 총 비용을 낮춰 에이전트 구축 및 실행을 더 경제적으로 만듭니다.
더 효율적임에도 불구하고 3.6 Flash 는 다양한 사용 사례에서 3.5 Flash 보다 성능이 우수합니다:
코드 편집이 더 정확해 불필요한 수정 및 실행 루프를 줄였으며, DeepSWE 에서 49%(3.5 Flash 는 37%) 를 달성했고 머신러닝 연구 벤치마크인 MLE Bench 에서 는 63.9%(3.5 Flash 는 49.7%) 로 크게 향상되었습니다
컴퓨터 조작 기능이 개선되어 OSWorld-Verified 점수가 83.0%(3.5 Flash 는 78.4%) 입니다. 컴퓨터 조작은 이제 Gemini API 및 Gemini Enterprise 를 통해 내장 클라이언트 도구로 제공됩니다
지식 작업 성능이 더 좋아져 GDPval-AA v2 벤치마크 점수가 1421(3.5 Flash 는 1349) 입니다. Hebbia 및 Harvey 와 같은 고객들은 문서 파싱, 차트 및 데이터 분석, 보고서 초안 작성 등 다중 모달 작업에서 특히 뛰어나다는 것을 발견했습니다
고객들은 3.6 Flash 가 비용과 품질 면에서 모두 진전되었으며 복잡한 워크플로우와 지식 기반 작업에서 토큰 효율성, 정확성 및 속도의 균형을 잘 맞춘다고 피드백했습니다.
보안 설계
3.6 Flash 는 화학, 생물학, 방사능 및 핵 (CBRN) 및 사이버 공격 남용 분야를 포함하는 강화된 최첨단 안전 보호 조치를 갖추고 있습니다. 이러한 보호 조치로 모델의 우회 공격에 대한 저항력이 크게 향상되었습니다. 동시에 모델은 유용한 용도에 대한 거부를 최소화하도록 훈련되었습니다.
Gemini 3.5 Flash-Lite: 에이전트 워크플로우 규모 확장을 위해 탄생
3.5 Flash-Lite 는 에이전트 검색 및 문서 처리와 같이 저지연 작업과 높은 처리량이 필요한 개발 시나리오를 위해 설계되었습니다.
3.5 Flash-Lite 는 3.5 시리즈 중 가장 빠른 모델입니다. Artificial Analysis 측정에 따르면 실행 속도는 초당 350 개의 출력 토큰에 달합니다. 입력 토큰 백만 개당 0.3 달러, 출력 토큰 백만 개당 2.5 달러의 가격으로 3.1 Flash-Lite 보다 품질이 크게 우수하며, 대용량 생산 작업을 실행하는 개발자와 고객에게 뛰어난 가성비를 제공합니다.
3.5 Flash-Lite 는 에이전트 시스템의 효율적인 확장을 지원합니다. 모든 사고 수준에서 이 모델은 3.1 Flash-Lite 보다 크게 우수합니다. 개발자는 워크로드에 따라 모델을 구성할 수 있습니다. 대량 작업에는 최소 및 저사고 수준을 사용하여 저지연, 저비용 실행을 우선시하거나, 더 높은 사고 수준을 활성화하여 다단계 서브 에이전트 워크로드를 처리할 수 있습니다. 이 모델은 이제 컴퓨터 조작을 내장 도구로 포함하여 크로스 인터페이스 에이전트 작업을 안정적으로 지원합니다.
코딩 및 에이전트 작업에서 크게 향상되었습니다. 예를 들어 Terminal-Bench 2.1 점수 54%(3.1 Flash-Lite 는 31%), GDM-MRCR v2 와 같은 긴 컨텍스트 점수 72.2%(3.1 Flash-Lite 는 60.1%), GDPval-AA v2 와 같은 실제 작업 실행 점수 1140(3.1 Flash-Lite 는 642) 입니다.
실제로 많은 에이전트 및 코딩 평가에서 3.5 Flash-Lite 는 SWE-Bench Pro(54.2% vs 49.6%) 및 OSWorld-Verified(74.0% vs 65.1%) 를 포함하여 3 Flash 보다도 뛰어나 2.5 및 3 Flash 워크로드에 대해 더 빠르고 강력한 선택지가 되었습니다.
초기 고객들은 에이전트 워크플로우 확장 및 데이터 처리 작업 측면에서 3.5 Flash-Lite 가 속도, 지능 및 비용 효율성을 독특하게 조합했다고 강조했습니다.
CodeMender 의 Gemini 3.5 Flash Cyber: 취약점을 효율적으로 발견 및 수정
AI 모델이 보안 취약점을 발견하는 속도는 현재 시스템이 이를 수정하는 속도를 이미 초과했습니다. 이러한 날로 심각해지는 위협에 대응하려면 효율적이고 강력한 소프트웨어 보안 방법이 필요합니다.
Flash 의 성능과 효율성은 코드 보안 문제를 대규모로 감지, 검증 및 패치하기 위한 이상적인 기반이 됩니다. Gemini 3.5 Flash Cyber 는 3.5 Flash 를 기반으로 구축되었으며 사이버 보안 취약점 발견 및 수정을 위해 미세 조정되었고 토큰당 가격은 대형 모델보다 낮습니다.
CodeMender 에서 여러 3.5 Flash Cyber 에이전트가 협력하여 단일 종합 보고서를 생성하며 인기 벤치마크인 CyberGym 에서 최첨단 경쟁 수준에 도달했습니다.
이 기술의 이중 용도 성격으로 인해 우리는 신중한 배포 방식을 취했습니다. 이 모델은 곧 CodeMender 를 통해 제한된 액세스 파일럿 프로젝트 형태로 정부 및 신뢰할 수 있는 파트너에게 독점적으로 제공될 예정입니다. 이를 통해 일선 방어자들이 핵심 취약점이 악용되기 전에 선제적으로 발견 및 수정할 수 있으며 동시에 더 광범위한 남용 위험을 완화할 수 있습니다.
지금 바로 시작하기
3.6 Flash 및 3.5 Flash-Lite 는 오늘부터 사용 가능합니다:
개발자는 Google AI Studio 및 Android Studio 의 Gemini API 를 통해 사용할 수 있습니다. 3.6 Flash 는 Google Antigravity 에서도 사용 가능합니다
기업은 Gemini Enterprise Agent 플랫폼에서 사용할 수 있습니다. 3.6 Flash 는 Gemini Enterprise 앱에서도 사용 가능합니다
모든 사용자는 Gemini 앱을 통해 사용할 수 있습니다. 3.5 Flash-Lite 는 Google 검색에서도 출시 예정입니다
향후 Gemini 모델 개선을 위한 피드백을 환영하며 곧 3.5 Pro 를 출시할 것을 기대합니다.
TechFlow 공식 커뮤니티에 오신 것을 환영합니다
Telegram 구독 그룹:https://t.me/TechFlowDaily
트위터 공식 계정:https://x.com/TechFlowPost
트위터 영어 계정:https://x.com/BlockFlow_News














