Inference Brew

Google, Gemini Flash 시리즈를 3.8 버전으로 업그레이드

00:00 / --:--

← 메인으로

Google, Gemini Flash 시리즈를 3.8 버전으로 업그레이드

1. Google, Gemini Flash 시리즈를 3.8 버전으로 업그레이드

2026년 8월 Gemini 3.7 Flash 출시 이후, Google은 Gemini 3.8 Flash를 선보였습니다. 이번 업데이트는 추론 및 코딩 기능을 개선했지만, 모델의 반복적인 도구 호출 사용 증가로 인해 전체 작업 비용이 약 40% 상승할 수 있습니다. 또한, 정부 및 신뢰할 수 있는 파트너로 제한된 취약점 탐지 전용 버전인 Gemini 3.8 Flash Cyber도 함께 출시했습니다.

  • • Gemini 3.8 Flash는 3.7 Flash 모델의 후속작으로, 추론 및 코딩 성능이 향상되었습니다.
  • • 이 모델은 100만 토큰 컨텍스트 윈도우를 제공하며, 2026년 말까지 입력 토큰 100만 개당 0.75달러, 출력 토큰 100만 개당 3.75달러의 가격이 책정되었습니다.
  • • 추론 단계 증가와 반복적인 도구 호출로 인해 이전 버전 대비 작업당 총 비용이 40% 더 높을 수 있습니다.
  • • Google은 자동화된 취약점 수정을 위해 조정된 제한적 모델 변형인 Gemini 3.8 Flash Cyber를 도입했습니다.
  • • 이 모델은 Artificial Analysis Intelligence Index에서 59점을 기록하여 Gemini 3.7 Flash보다 3점 향상되었습니다.

개발자들은 이제 Flash 시리즈에서 더 뛰어난 추론 모델을 사용할 수 있게 되었으나, 모델의 집중적인 추론 과정으로 인한 잠재적 비용 증가를 고려해야 합니다.

2. Meta, 성능이 향상된 Muse Spark 1.3 버전 업데이트

Meta는 8월에 출시된 1.2 버전에 이어 Muse Spark 모델 라인을 1.3 버전으로 업데이트했습니다. 새로운 버전은 이전 버전과 동일한 가격 구조를 유지하면서 코딩, 에이전트 워크플로우 및 과학적 추론 분야에서 성능 향상을 제공합니다. Muse Spark 1.3 (xhigh) 변형은 현재 Meta의 API와 Muse Code를 통해 사용할 수 있으며, 더 강력한 'max' 변형은 현재 제한된 프리뷰로 제공됩니다.

  • • Meta는 코딩, 에이전트 작업 및 과학적 추론 분야에서 상당한 성능 향상을 제공하는 Muse Spark 1.3을 출시했습니다.
  • • Muse Spark 1.3 (xhigh) 변형은 현재 사용 가능하며, Artificial Analysis Intelligence Index에서 61점을 기록했습니다.
  • • xhigh 변형의 가격은 입력 토큰 100만 개당 1.25달러, 출력 토큰 100만 개당 4.25달러로 변동이 없습니다.
  • • 더 강력한 Muse Spark 1.3 (max) 변형은 현재 파트너를 대상으로 제한적 프리뷰가 진행 중입니다.

개발자들은 토큰 비용 증가 없이 Meta의 기존 API 및 Muse Code 생태계를 통해 더 뛰어난 추론 및 코딩 모델을 사용할 수 있습니다.

3. Google, Gemini 모델을 위한 에이전트 기반 비디오 이해 기능 출시

Google은 Gemini 제품군의 여러 모델에 걸쳐 에이전트 기반 비디오 이해 기능을 출시했습니다. 기본 비디오 처리 도구와 모델의 핵심 추론 기능을 결합함으로써, 이 업데이트는 복잡한 비디오 분석 작업의 성능을 향상시킵니다. 개발자는 이러한 기능을 활용하여 비디오 스트림 내 자동 순간 검색, 이상 탐지 및 정밀한 객체 계수를 위한 보다 강력한 애플리케이션을 구축할 수 있습니다.

  • • Google은 여러 Gemini 모델을 위한 에이전트 기반 비디오 이해 기능을 출시했습니다.
  • • 이 기능은 기본 비디오 도구와 모델 추론을 결합합니다.
  • • 순간 검색, 이상 탐지 및 계수와 같은 작업의 성능을 향상시킵니다.

개발자들은 순간 검색, 이상 탐지, 객체 계수와 같은 복잡한 비디오 작업을 더 높은 정확도로 수행하는 애플리케이션을 구축할 수 있습니다.

SOURCES

4. Multiverse Computing, 플래그십 추론 모델 Quasar 438B 출시

Multiverse Computing은 영어와 스페인어를 모두 지원하는 플래그십 추론 모델인 Quasar 438B로 대규모 모델 시장에 진입했습니다. 엔터프라이즈급 에이전트, 기술 코파일럿 및 워크플로우 자동화를 위해 설계된 이 모델은 Artificial Analysis Intelligence Index v4.1.1에서 43점을 기록하며 유럽 모델 중 최고점을 달성했습니다. 터미널 환경(Terminal-Bench v2.1에서 69.3점)과 긴 문서 추론(AA-LCR에서 75.0점)에서 강력한 성능을 입증했으며, CompactifAI API를 통해 액세스할 수 있습니다.

  • • Multiverse Computing은 영어와 스페인어를 지원하는 첫 번째 대규모 추론 모델인 Quasar 438B를 출시했습니다.
  • • 이 모델은 Artificial Analysis Intelligence Index v4.1.1에서 43점을 기록하여 유럽 모델 중 가장 높은 결과를 얻었습니다.
  • • AA-LCR 긴 문서 추론 벤치마크에서 75.0점, 터미널 환경을 위한 Terminal-Bench v2.1에서 69.3점을 기록했습니다.
  • • Quasar 438B는 CompactifAI API를 통해 테스트 및 배포할 수 있습니다.
  • • 이 모델은 500토큰 응답을 15.3초 만에 완료합니다.

개발자들은 CompactifAI API를 통해 복잡한 터미널 환경과 긴 문서 추론을 위한 새로운 고성능 이중 언어 옵션을 확보하게 되었습니다.

SOURCES

5. Vercel, 동적 워크로드 확장을 위한 Fluid 컴퓨팅 계층 도입

Vercel은 실시간 워크로드 수요에 따라 인프라를 동적으로 구성하도록 설계된 통합 컴퓨팅 계층인 Fluid를 도입했습니다. 갑작스러운 버스트 용량을 흡수하도록 설계된 Fluid는 빌드, 샌드박스 및 서버리스 함수를 원활하게 처리합니다. 이 시스템은 이미 대규모로 운영되고 있으며, 월 1조 건 이상의 요청을 처리하여 현대적인 웹 및 AI 애플리케이션을 위한 높은 가용성과 성능을 보장합니다.

  • • Vercel은 다양한 워크로드를 위해 인프라를 동적으로 구성하는 통합 컴퓨팅 계층인 Fluid를 도입했습니다.
  • • 이 시스템은 빌드, 샌드박스 및 함수에 대한 버스트 용량을 흡수하도록 설계되었습니다.
  • • Fluid는 현재 월 1조 건 이상의 요청을 지원하도록 확장됩니다.

Vercel에 AI 앱을 배포하는 개발자들은 수동 구성 없이도 대규모 트래픽 급증을 처리할 수 있는 더 탄력적이고 동적으로 확장 가능한 인프라를 얻게 됩니다.

SOURCES

6. WebLLM, WebGPU를 통한 고성능 브라우저 내 LLM 추론 지원

MLC LLM의 동반 프로젝트인 WebLLM은 WebGPU로 구동되는 고성능 브라우저 내 추론 엔진을 제공합니다. 완전히 클라이언트 측에서 실행되므로 서버 비용과 지연 시간을 제거하는 동시에 스트리밍, JSON 모드 및 함수 호출을 포함한 OpenAI API 표준과의 호환성을 유지합니다. 개발자는 NPM 또는 CDN을 사용하여 엔진을 웹 애플리케이션에 쉽게 통합하고, 무거운 계산을 Web Worker로 오프로드하여 UI 응답성을 유지하며, MLC 형식으로 컴파일된 사용자 지정 모델을 배포할 수 있습니다.

  • • WebLLM은 WebGPU 하드웨어 가속을 사용하여 브라우저 내에서 언어 모델을 완전히 실행합니다.
  • • 이 엔진은 OpenAI API와 호환되며 스트리밍, JSON 모드 및 함수 호출을 지원합니다.
  • • Llama 3, Phi 3, Gemma, Mistral 및 Qwen을 포함한 인기 있는 오픈 모델을 기본적으로 지원합니다.
  • • 개발자는 NPM, Yarn 또는 CDN을 통해 WebLLM을 통합하고 계산을 Web Worker 또는 Service Worker로 오프로드할 수 있습니다.
  • • 이 엔진은 SRI(Subresource Integrity) 해시를 사용하여 모델 아티팩트에 대한 선택적 무결성 검증을 제공합니다.

개발자들은 OpenAI 호환 API를 사용하여 사용자의 브라우저에서 직접 모델을 실행하는 완전히 로컬화된 개인 정보 보호 웹 애플리케이션을 구축할 수 있습니다.

SOURCES

7. Perplexity, Apple Silicon 온디바이스 추론 최적화를 위한 Lily 오픈 소스 공개

Perplexity AI는 Apple Silicon에서 온디바이스 LLM 성능을 극대화하기 위해 설계된 경량 Mac 추론 서버인 Lily를 오픈 소스로 공개했습니다. 희소 MoE 라우팅 및 Gated DeltaNet 계층을 특징으로 하는 Qwen3.6-35B-A3B 모델에 맞게 특별히 조정된 Lily는 통합 메모리와 Apple의 특수 하드웨어를 활용하여 MLX-LM을 능가하는 프리필 및 디코드 처리량을 제공합니다. 저장소는 GitHub에서 사용할 수 있으며, 개발자는 단일 Mac에서 매우 효율적인 로컬 추론을 호스팅할 수 있습니다.

  • • Perplexity AI는 Mac 추론 서버로 설계된 'lily' 저장소를 GitHub에 오픈 소스로 공개했습니다.
  • • 이 엔진은 Apple Silicon에서 최고의 성능을 달성하기 위해 Qwen3.6-35B-A3B 모델에 특별히 최적화되었습니다.
  • • Lily는 통합 메모리와 특수 하드웨어를 활용하여 MLX-LM보다 더 높은 프리필 및 디코드 처리량을 제공합니다.
  • • Qwen3.6-35B-A3B 모델은 희소 MoE 라우팅 및 Gated DeltaNet 계층을 활용합니다.

개발자들은 MLX-LM보다 뛰어난 프리필 및 디코드 처리량으로 단일 Mac에서 대규모 희소 MoE 모델을 로컬로 실행할 수 있습니다.

SOURCES

8. Worlds via Code, Claude Fable 5.1을 사용하여 탐색 가능한 3D 장면 생성

'Worlds via code' 프로젝트는 자율적인 Claude Fable 5.1 에이전트 스웜을 사용하여 실제 위치의 브라우저 네이티브 탐색 가능한 3D 재구성을 생성하는 새로운 파이프라인을 시연했습니다. 독점 게임 엔진 없이 완전히 Three.js 애플리케이션으로 구축된 현재 데모는 129개의 상점, 작동하는 신호등 및 대화형 인테리어를 특징으로 하는 상세한 샌프란시스코 광장을 재구성합니다. 정찰, Blender 자산 생성, 런타임 조립 및 Playwright 기반 품질 보증에 이르는 전체 파이프라인은 MIT 라이선스에 따라 오픈 소스로 제공됩니다.

  • • 'Worlds via code' 프로젝트는 Claude Fable 5.1 에이전트 스웜을 사용하여 실제 위치의 브라우저 네이티브 탐색 가능한 재구성을 생성합니다.
  • • 재구성은 게임 엔진이나 독점 3D 타일 없이 Three.js 애플리케이션으로 구축됩니다.
  • • 현재 데모는 129개의 상점, 작동하는 신호등 및 탐색 가능한 인테리어를 갖춘 샌프란시스코 광장을 재구성합니다.
  • • 이 파이프라인은 정찰, Blender에서의 오프라인 자산 생성, 런타임 조립, Playwright를 통한 카메라 매치 QA의 4단계 프로세스를 사용합니다.
  • • 프로젝트의 코드와 자산은 OpenStreetMap 및 USGS 3DEP 데이터를 사용하여 MIT 라이선스에 따라 라이선스가 부여됩니다.

개발자들은 독점 게임 엔진에 의존하지 않고 실제 공간 데이터를 대화형 Three.js 애플리케이션으로 변환하는 MIT 라이선스 파이프라인을 연구하거나 채택할 수 있습니다.

SOURCES

9. Switch, Slack, Teams 및 Discord에서 AI 에이전트를 로컬로 실행

Switch는 AI 모델과 에이전트를 Slack, Microsoft Teams 및 Discord에 직접 연결하도록 설계된 로컬 소프트웨어 도구로 출시되었습니다. 완전히 로컬에서 작동하며 계정 생성이 필요 없는 Switch를 통해 개발자는 플랫폼 종속이나 기본 인프라를 마이그레이션할 필요 없이 기존 채팅 채널 내에서 에이전트 워크플로우를 테스트하고 실행할 수 있습니다.

  • • Switch를 사용하면 사용자가 AI 모델, 인프라 및 에이전트를 로컬에서 실행할 수 있습니다.
  • • 이 도구는 에이전트를 Slack, Microsoft Teams 및 Discord와 몇 분 안에 통합합니다.
  • • 사용하기 위해 계정이 필요하지 않으며 플랫폼 종속이나 마이그레이션을 방지합니다.

개발자들은 복잡한 클라우드 인프라를 설정하거나 외부 계정을 만들지 않고도 Slack, Teams 또는 Discord에서 대화형 에이전트를 빠르게 배포하고 테스트할 수 있습니다.

SOURCES

10. Hugging Face, 브라우저 추론을 위한 최적화된 WebGPU 커널 출시

Hugging Face는 207개의 고도로 최적화된 WebGPU 커널을 포함하는 전용 라이브러리인 @huggingface/kernels를 출시했습니다. 이 라이브러리는 클라이언트 측 AI 모델 추론을 가속화하기 위해 구축되었으며, 웹 개발자가 최소한의 지연 시간과 최대 하드웨어 활용도로 브라우저 내에서 복잡한 신경망 작업을 직접 실행할 수 있도록 합니다.

  • • Hugging Face는 @huggingface/kernels 라이브러리를 도입했습니다.
  • • 이 라이브러리에는 207개의 최적화된 WebGPU 커널이 포함되어 있습니다.
  • • 웹 브라우저 내에서 직접 AI 모델 추론을 가속화하도록 설계되었습니다.

웹 개발자들은 이러한 사전 최적화된 커널을 활용하여 클라이언트 측 모델 실행 속도를 크게 높이고 더 반응성이 뛰어난 로컬 AI 기능을 구축할 수 있습니다.

SOURCES

11. Anthropic, C2PA 파일 검사 도구 및 탐지 API 프리뷰 출시

보이지 않는 워터마킹을 구현하겠다는 8월의 약속을 기반으로, Anthropic은 이제 파일이 Claude에 의해 처리되었는지 확인하기 위해 암호화 서명된 C2PA 메타데이터를 읽는 도구를 출시했습니다. 이 도구는 사용자 기기에서 로컬로 작동합니다. 또한, 조직이 EU AI 규정을 준수하여 콘텐츠 출처를 확인할 수 있도록 텍스트 워터마크 탐지 API의 비공개 프리뷰를 시작했습니다.

  • • Anthropic은 .png, .jpg 및 .svg 파일의 C2PA 메타데이터를 확인하는 로컬 도구를 출시했습니다.
  • • 텍스트 워터마크 탐지 API의 비공개 프리뷰를 이제 적격 조직에서 사용할 수 있습니다.
  • • 이러한 출시는 Claude가 생성한 콘텐츠를 탐지하기 위한 기술적 수단을 제공하겠다는 회사의 이전 약속을 이행합니다.
  • • 파일 검사 도구는 파일을 Anthropic으로 보내지 않고 메타데이터를 로컬에서 처리하여 개인 정보를 보호합니다.

이러한 도구는 Anthropic이 이전에 발표한 출처 표준의 실질적인 구현을 제공하여 개발자와 조직이 Claude가 생성한 콘텐츠를 확인할 수 있도록 합니다.

SOURCES

12. Unsloth, DeepSeek-V4-Flash-Vision-Exp에 대한 GGUF 양자화 지원

8월 31일 Hugging Face에 DeepSeek-V4-Flash-Vision-Exp 가중치가 릴리스된 것을 기반으로, Unsloth는 이제 모델에 대한 GGUF 형식 지원을 병합했습니다. 이 업데이트를 통해 개발자는 실험적인 비전 기능 모델의 양자화 버전을 로컬에서 실행하여 리소스가 제한된 환경으로의 통합을 촉진할 수 있습니다.

  • • Unsloth는 DeepSeek-V4-Flash-Vision-Exp 모델에 대한 GGUF 지원을 추가했습니다.
  • • 이는 8월 31일 Hugging Face에 모델 가중치가 릴리스된 이후의 조치입니다.
  • • 이 업데이트는 실험적인 비전 모델에 대한 로컬 양자화 추론을 가능하게 합니다.

이 개발을 통해 개발자들은 단순히 원시 가중치를 호스팅하는 것에서 나아가 DeepSeek-V4-Flash-Vision-Exp 모델의 최적화된 양자화 버전을 로컬에서 실행할 수 있게 되었습니다.

SOURCES

13. llama.cpp, Apple M5 신경 가속기에 대한 Metal 지원 공식 추가

llama.cpp 프로젝트는 M5 행렬 곱셈 및 신경 가속기를 기본적으로 지원하도록 Metal 백엔드를 업데이트했습니다. 이 공식 통합은 이전에 사용자 지정 w8a8 커널이 필요했던 성능 격차를 해결하여 M5 하드웨어에서 Unsloth의 Q_8 GGUF 모델에 대한 프리필 성능을 초당 300-350토큰으로 끌어올렸습니다. M5 Pro에서 Q8 범위의 Qwen3.8 27B 모델에 대해 생성 속도가 초당 19토큰에 도달함에 따라, llama.cpp는 이제 기본 MLX 모델과 동등한 성능을 달성했습니다.

  • • llama.cpp는 이제 M5 matmul 및 신경 가속기에 대한 기본 Metal 지원을 포함합니다.
  • • 이 업데이트는 M5 성능을 잠금 해제하기 위해 이전에 보고된 사용자 지정 w8a8 커널의 필요성을 대체합니다.
  • • M5 하드웨어에서 Unsloth의 Q_8 GGUF 모델에 대한 프리필 성능은 이제 초당 300-350토큰에 도달합니다.
  • • M5 Pro에서 Q8 범위의 Qwen3.8 27b 모델에 대해 초당 약 19토큰의 생성 속도가 관찰되었습니다.

개발자들은 이제 기본 16비트 활성화 제한을 우회하기 위해 타사 사용자 지정 커널에 의존하지 않고도 주요 llama.cpp 프로젝트 내에서 직접 M5 하드웨어 가속을 활용할 수 있습니다.

SOURCES

14. VoxGen, 경량 AMD 최적화 TTS 추론 엔진 출시

VoxGen은 VoxCPM2 모델을 위해 특별히 설계된 경량 네이티브 텍스트 음성 변환 추론 엔진으로 출시되었습니다. Rust로 작성되고 Vulkan 컴퓨팅으로 구동되는 VoxGen은 Python, PyTorch 및 CUDA를 완전히 우회하여 AMD 그래픽 카드(XTX 7900을 위한 전용 모드 포함)에서 최적화된 성능을 제공합니다. 이 엔진은 셸에서 직접 실행되므로 개발자가 로컬의 짧은 지연 시간 음성 합성 기능을 애플리케이션과 스크립트에 쉽게 통합할 수 있습니다.

  • • VoxGen은 Rust로 작성된 VoxCPM2 모델을 위한 경량 네이티브 추론 엔진입니다.
  • • 이 엔진은 Python, PyTorch 또는 CUDA 대신 Vulkan 컴퓨팅을 활용하여 AMD GPU에 대한 성능을 최적화합니다.
  • • AMD Radeon XTX 7900을 위한 특정 최적화 모드를 특징으로 합니다.
  • • 애플리케이션은 셸에서 실행되어 외부 스크립트 및 프로그램과의 쉬운 통합을 허용합니다.
  • • 설치하려면 VoxGen 실행 파일과 Hugging Face의 모델 파일 2개가 필요합니다.

개발자들은 무거운 Python 또는 PyTorch 종속성에 의존하지 않고 AMD 하드웨어에서 로컬 고성능 음성 합성을 실행할 수 있습니다.

SOURCES

15. Mistral, Vibe 및 API 사용자를 위한 데이터 학습 거부 설정 상세 설명

Mistral은 사용자 및 개발자가 자신의 입력 및 출력 데이터가 모델 학습에 사용되는 것을 거부하기 위해 필요한 구체적인 단계를 설명했습니다. Vibe Enterprise 계정은 기본적으로 거부되지만, 표준 Vibe, 모바일 및 API 사용자는 설정을 수동으로 조정해야 합니다. Mistral Studio 또는 API를 사용하는 개발자는 관리자 패널에서 '익명 개선 데이터(Anonymous improvement data)' 토글을 비활성화하여 데이터를 보호할 수 있으며, Vibe 및 API 거부 구성은 별도로 관리된다는 점을 유의해야 합니다.

  • • Mistral은 사용자가 거부하지 않는 한 사용자 대화 및 업로드된 문서를 모델 학습에 사용할 수 있습니다.
  • • Vibe Enterprise 고객은 기본적으로 학습에서 제외되지만, 표준 Vibe 사용자는 설정을 통해 수동으로 거부해야 합니다.
  • • API 및 Mistral Studio 사용자는 관리자 패널에서 '익명 개선 데이터' 토글을 비활성화하여 거부할 수 있습니다.
  • • iOS 및 Android의 모바일 앱 사용자는 설정에서 '데이터 공유 활성화'를 선택 해제하여 거부할 수 있습니다.
  • • Vibe 및 API에 대한 거부 설정은 별개이므로 개별적으로 구성해야 합니다.

개발자와 팀은 독점적인 입력 및 출력이 모델 학습에 사용되는 것을 방지하기 위해 Mistral 관리자 패널에서 개인 정보 보호 설정을 수동으로 구성해야 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.