Inference Brew

Alibaba, 오픈 웨이트 Qwen3.8-27B 모델 공개

00:00 / --:--

← 메인으로

Alibaba, 오픈 웨이트 Qwen3.8-27B 모델 공개

1. Alibaba, 오픈 웨이트 Qwen3.8-27B 모델 공개

Alibaba가 Qwen3.8-27B 모델의 오픈 웨이트 버전을 공개하겠다는 약속을 이행했습니다. 이번 출시는 앞서 발표된 Qwen3.8-Max 모델에 이어지는 것으로, 개발자들에게 소비자용 하드웨어에 최적화된 고성능 멀티모달 모델을 제공합니다.

  • • Alibaba가 270억 파라미터의 Qwen3.8-27B 모델을 Hugging Face에 Apache 2.0 라이선스로 공개했습니다.
  • • 이 모델은 네이티브 이미지 및 비디오 이해 능력, 262,144 토큰의 컨텍스트 윈도우, 강력한 에이전트 기능을 갖추고 있습니다.
  • • SWE-bench Pro에서 61.7점, LiveCodeBench v6에서 90.3점을 기록했습니다.
  • • 4비트 양자화 모델 실행 시 약 17GB의 GPU 메모리가 필요하며, 고사양 소비자용 하드웨어와 호환됩니다.
  • • RTX 3090에서 최적화된 추론 시 그리디 모드에서 초당 최대 124 토큰의 속도를 달성합니다.

개발자들은 이제 이전에 출시된 프런티어급 Max 모델을 보완하는 Qwen3.8 시리즈의 27B 버전을 로컬 환경에 배포할 수 있게 되었습니다.

2. Z.ai, GLM 5.3 가격, 벤치마크 및 새로운 OpenVuln 서비스 상세 공개

8월 14일 GLM 5.3 추론 모델 발표에 이어, Z.ai가 상용화에 대한 세부 정보를 제공했습니다. 이 모델은 입력 토큰 100만 개당 1.40달러, 출력 토큰 100만 개당 4.40달러로 책정되었으며, Artificial Analysis Intelligence Index에서 60점을 기록했습니다. 또한, GLM 5.3을 활용하여 코드 저장소의 보안 취약점을 스캔하는 서비스인 OpenVuln을 출시했습니다.

  • • GLM 5.3의 가격은 입력 토큰 100만 개당 1.40달러, 출력 토큰 100만 개당 4.40달러입니다.
  • • 이 모델은 Artificial Analysis Intelligence Index에서 60점을 기록하며 Kimi K3 모델과 동점을 이뤘습니다.
  • • Z.ai는 GLM 5.3 기반의 코드 취약점 스캔 서비스인 OpenVuln을 출시했습니다.
  • • GLM 5.3의 오픈 웨이트 버전은 다음 주 내로 MIT 라이선스 하에 공개될 예정입니다.

개발자들은 이제 GLM 5.3의 프로덕션 사용 여부를 평가할 수 있는 명확한 가격 및 성능 데이터와 함께 보안 워크플로우를 위한 새로운 전문 도구를 확보하게 되었습니다.

3. OpenMOSS, 실시간 비디오 이해를 위한 MOSS-VL 11B 출시

OpenMOSS의 MOSS-VL은 실시간 비디오 이해를 위해 설계된 110억 파라미터 규모의 오픈 비전-언어 모델입니다. 이 모델은 실시간 비디오 프레임을 인식하면서 음성 응답을 생성할 수 있으며, 선제적 침묵(proactive silence) 및 동적 자기 교정 기능을 내장하고 있습니다.

  • • OpenMOSS가 110억 파라미터 규모의 오픈 비전-언어 모델 MOSS-VL을 출시했습니다.
  • • 이 모델은 실시간 비디오 이해를 위해 설계되었으며, 응답을 생성하는 동안 실시간 프레임을 인식합니다.
  • • 선제적 침묵과 동적 자기 교정을 위한 내장 기능을 포함하고 있습니다.

개발자들은 선제적 침묵과 동적 자기 교정을 지원하는 모델을 통해 실시간 대화형 비디오 애플리케이션을 구축할 수 있습니다.

SOURCES

4. 오픈소스 음성 모델 Confucius4-TTS, 대규모 업그레이드 발표

오픈소스 Confucius4-TTS 모델이 음성 품질과 실용성 향상에 초점을 맞춘 대규모 업그레이드를 단행했습니다. 새로 발표된 arXiv 논문에 상세히 기술된 이 모델은 개발자들에게 다국어 및 교차 언어 음성 생성을 위한 매우 뛰어난 오픈소스 옵션을 제공합니다.

  • • 다국어 및 교차 언어 음성 생성 오픈소스 모델인 Confucius4-TTS가 대규모 업그레이드를 진행했습니다.
  • • 이번 업그레이드는 개발자를 위한 음성 품질과 실용성 향상에 중점을 두었습니다.
  • • 모델의 아키텍처와 기능을 상세히 다룬 연구 논문이 arXiv에 게재되었습니다.

음성 기반 애플리케이션을 구축하는 개발자들은 향상된 실용성을 갖춘 업그레이드된 오픈소스 다국어 텍스트 음성 변환(TTS) 모델을 활용할 수 있습니다.

SOURCES

5. Apple Silicon용 Qwen3.8-27B 검열 해제 버전 출시

Apple Silicon에서 Qwen3.8-27B를 사용할 수 있게 된 것에 이어, OrcaRouter가 Qwen3.8-27B-Uncensored-MLX를 출시했습니다. 이 새로운 변형 모델은 27B 아키텍처의 검열 해제 버전으로, Mac 하드웨어에서의 로컬 추론을 위해 양자화되었습니다.

  • • OrcaRouter가 밀집형 하이브리드 어텐션 모델인 Qwen3.8-27B-Uncensored-MLX를 출시했습니다.
  • • 이 모델은 Apple Silicon용으로 양자화되었으며 2비트에서 8비트 버전으로 제공됩니다.
  • • 이는 최근 Mac 하드웨어에서 기본 Qwen3.8-27B 모델에 대한 추측적 디코딩(speculative decoding) 지원이 도입된 이후의 행보입니다.

이번 출시는 이전에 Apple Silicon에 최적화되었던 표준 Qwen3.8-27B 모델의 검열 해제 대안을 제공함으로써 Mac 사용자를 위한 로컬 모델 생태계를 확장합니다.

SOURCES

6. GLM-5.2, Crusoe 서버리스 파인튜닝 서비스에 추가

Crusoe가 서버리스 파인튜닝 서비스에 GLM-5.2 지원을 추가했습니다. 이번 통합을 통해 개발자들은 Crusoe의 비용 최적화된 서버리스 인프라를 활용하여 100만 컨텍스트 코딩 및 에이전트 모델을 파인튜닝하고 배포할 수 있게 되었습니다.

  • • GLM-5.2가 Crusoe의 서버리스 파인튜닝 및 셀프 서비스 배포를 지원하게 되었습니다.
  • • 이번 통합으로 유휴 GPU 비용을 제거하여 100만 컨텍스트 모델을 비용 효율적으로 커스터마이징할 수 있습니다.
  • • 이번 개발은 Crusoe의 파인튜닝 서비스와 GLM-5.2 오픈 웨이트 모델의 독립적인 가용성을 하나로 연결합니다.

이번 업데이트를 통해 개발자들은 GLM-5.2의 장기 추론 능력과 Crusoe 서버리스 파인튜닝의 비용 효율성을 결합할 수 있으며, 모델 커스터마이징 중 유휴 GPU 시간에 대한 비용 지불을 제거할 수 있습니다.

SOURCES

7. P2P 에이전트 네트워킹을 위한 SAM(Sovereign Agent Mesh) 출시

SAM(Sovereign Agent Mesh)은 자율 AI 에이전트가 Model Context Protocol을 통해 도구를 공유할 수 있는 탈중앙화된 제로 트러스트 P2P 네트워크를 제공합니다. 이 프로젝트는 오프라인 인증을 위해 OIDC 및 Biscuit Datalog 토큰을 사용하여 API 키 노출 없이 안전한 도구 공유를 보장합니다.

  • • SAM(Sovereign Agent Mesh)은 자율 AI 에이전트를 위한 Apache 2.0 라이선스 P2P 네트워킹 프로젝트입니다.
  • • Model Context Protocol(MCP)을 통해 에이전트 간 도구 공유를 위한 제로 구성, 제로 트러스트 P2P 오버레이를 제공합니다.
  • • 아키텍처는 신원을 위해 OIDC를 사용하며, 클레임을 Biscuit Datalog 토큰으로 변환하여 오프라인 인증을 가능하게 합니다.
  • • 보안 아웃바운드 게이트웨이가 트래픽을 가로채 자격 증명을 주입함으로써 실제 API 키가 에이전트 샌드박스 외부로 나가지 않도록 합니다.
  • • 퍼블릭 메시는 현재 베타 테스트넷 단계이며, 프로덕션 환경에서는 컨트롤 플레인을 직접 호스팅하는 것을 권장합니다.

개발자들은 에이전트가 암호화 토큰을 사용하여 오프라인에서 안전하게 도구를 공유하고 요청을 승인할 수 있는 안전한 탈중앙화 멀티 에이전트 네트워크를 구축할 수 있습니다.

SOURCES

8. Block, 로컬 에이전트 워크스페이스 'Berd' 오픈소스화

Block의 Berd는 AI 에이전트를 관리하기 위한 모델 독립적 워크스페이스를 제공하는 오픈소스 로컬 데스크톱 애플리케이션입니다. 이 애플리케이션은 Agent Client Protocol을 사용하여 Goose 프레임워크와 통신하며, 대화 기록을 로컬에 저장하고 자격 증명을 OS 키체인에 보관합니다.

  • • Block이 AI 에이전트 작업을 위한 로컬 설치형 그래픽 데스크톱 애플리케이션인 Berd를 오픈소스화했습니다.
  • • 이 애플리케이션은 GitHub에서 Apache 2.0 라이선스로 macOS, Windows, Linux용으로 제공됩니다.
  • • Berd는 Goose 에이전트 프레임워크와 통신하기 위해 Agent Client Protocol(ACP)을 사용합니다.
  • • 모델 독립적이므로 사용자가 선호하는 AI 제공업체와 에이전트 하네스를 직접 구성할 수 있습니다.
  • • 데이터 모델은 로컬 우선 방식으로, 대화 기록을 기기에 저장하고 자격 증명을 OS 키체인에 보관합니다.

개발자들은 다양한 모델과 프레임워크 전반에서 에이전트를 구성, 실행 및 테스트할 수 있는 로컬 우선의 맞춤형 그래픽 인터페이스를 얻게 됩니다.

SOURCES

9. NVIDIA, TensorRT Model Connect 퍼블릭 프리뷰 출시

NVIDIA의 TensorRT Model Connect(TRTMC)는 Hugging Face 체크포인트를 네이티브 C++ TensorRT 추론으로 배포하는 과정을 간소화합니다. 이 도구는 중간 ONNX 내보내기 및 PyTorch 런타임 의존성을 우회하여 단 두 개의 명령어로 고도로 최적화된 아티팩트를 생성합니다.

  • • NVIDIA가 Apache 2.0 라이선스로 TensorRT Model Connect(TRTMC) 퍼블릭 프리뷰를 출시했습니다.
  • • 이 도구는 Hugging Face 또는 로컬 체크포인트를 단 두 개의 명령어로 엔드 투 엔드 TensorRT 추론으로 변환합니다.
  • • 중간 ONNX 내보내기 단계를 제거하고 네이티브 C++ 작업 API를 통해 실행되는 버전 관리 아티팩트를 생성합니다.
  • • 현재 릴리스 휠은 Linux aarch64로 제한되며, x86_64 플랫폼은 Docker 소스 빌드 경로를 사용해야 합니다.
  • • 7월 29일 스냅샷에서 102개 프로필 전반에 걸쳐 5% 이상의 성능 향상을 입증했습니다.

개발자들은 중간 ONNX 내보내기 단계를 우회하여 PyTorch 오버헤드 없이 고도로 최적화된 TensorRT 모델을 네이티브 C++ 런타임에 직접 배포할 수 있습니다.

SOURCES

10. Artificial Analysis, AI 에이전트용 검색 인덱스 출시

Artificial Analysis 검색 인덱스는 AI 에이전트 워크플로우 내에서 검색 API 성능을 평가하기 위한 표준화된 벤치마크를 제공합니다. Stirrup 에이전트 하네스를 사용하여 Exa 및 Firecrawl과 같은 제공업체를 테스트함으로써, 개발자가 검색 품질, 지연 시간 및 모델 토큰 비용 간의 균형을 맞출 수 있도록 돕습니다.

  • • Artificial Analysis가 AI 에이전트 사용을 위한 검색 API 제공업체 벤치마크용 검색 인덱스를 출시했습니다.
  • • 초기 커버리지에는 Parallel, Exa, Firecrawl, You.com, Tavily, Keenable, Brave가 포함됩니다.
  • • Parallel, Exa, Firecrawl이 출시 시점에 가장 높은 전체 검색 인덱스 점수(각각 75, 74, 73점)를 기록했습니다.
  • • 검색 API 통합 시 에이전트 벤치마크 성능이 모델 전용 베이스라인의 33점에서 65~75점으로 향상되었습니다.
  • • 더 높은 품질의 검색 결과는 모델 토큰 사용량을 40% 이상 줄여 전체 작업 비용을 절감했지만, 검색 통합으로 인해 작업당 지연 시간은 증가했습니다.

개발자들은 에이전트 워크플로우에 최적의 검색 API를 선택하여 검색 품질을 극대화하고 모델 토큰 비용을 최대 40%까지 절감할 수 있습니다.

SOURCES

11. machine0, 지속형 에이전트 컴퓨팅 VM을 위한 CLI 출시

machine0은 장기 AI 에이전트 컴퓨팅을 위해 특별히 설계된 지속형 클라우드 VM을 관리하는 CLI 도구를 제공합니다. 이 서비스는 직접적인 GPU 지원을 포함하는 완전한 KVM 가상 머신을 제공하여, 에이전트가 프로그래밍 방식으로 자체 컴퓨팅 리소스를 생성, 스냅샷 생성 및 삭제할 수 있도록 합니다.

  • • machine0이 장기 AI 에이전트 컴퓨팅을 위해 설계된 지속형 클라우드 VM 관리용 CLI 도구를 출시했습니다.
  • • 이 서비스는 99.99% 가동 시간을 보장하는 완전한 KVM 가상 머신을 제공하며, 시간당 0.013달러부터 분 단위로 과금됩니다.
  • • 하드웨어 구성은 1 vCPU부터 8xH200 GPU까지 다양하며, 최대 16TB의 지속형 블록 스토리지를 지원합니다.
  • • 에이전트는 CLI나 MCP를 사용하여 자체 컴퓨팅 리소스를 생성, 스냅샷 생성 및 삭제할 수 있습니다.

개발자들은 AI 에이전트가 직접적인 GPU 지원을 갖춘 완전한 KVM 가상 머신을 프로그래밍 방식으로 생성, 스냅샷 생성 및 삭제할 수 있도록 할 수 있습니다.

SOURCES

12. Nous Research, Hermes Agent에 멀티 에이전트 '봇 모드' 추가

Nous Research가 Hermes Agent(v0.20.3)에 새로운 '봇 모드'를 추가하여, 개발자들이 개별 에이전트 프로필 관리에서 벗어나 명명된 로컬 봇 팀을 오케스트레이션할 수 있게 했습니다. 이 업데이트를 통해 봇들은 지속형 에이전트 받은 편지함(Agent Inbox)을 사용하여 2~6명의 그룹 채팅에서 상호 작용할 수 있으며, 새로운 스토리지 계층 없이도 에이전트의 기존 메모리 및 기술 프리미티브를 활용할 수 있습니다.

  • • Nous Research가 오픈소스 Hermes Agent v0.20.3에 봇 모드를 출시했습니다.
  • • 봇 모드는 사용자가 명명된 에이전트 프로필을 팀으로 그룹화하여 멀티 에이전트 협업을 가능하게 합니다.
  • • 봇들은 지속형 에이전트 받은 편지함을 통해 로컬에서 통신하며, 2~6개 에이전트의 그룹 채팅을 지원합니다.
  • • 이 기능은 기존 Hermes 프로필 프리미티브를 활용하여 각 봇의 개별 메모리, 기술 및 모델 구성을 유지합니다.
  • • 이 도구는 엔터프라이즈급 기능보다는 로컬 실행에 중점을 두고 개인 빌더와 소규모 팀을 위해 설계되었습니다.

이번 업데이트는 Hermes Agent를 단일 에이전트 도구에서 협업형 멀티 에이전트 시스템으로 진화시켜, 개발자들이 새로운 스토리지 인프라 없이도 로컬 프로필 기반 에이전트 팀을 배포할 수 있게 합니다.

SOURCES

13. Warp, 에이전트 생태계에 지속형 메모리 추가

이달 초 출시된 Warp Agent CLI를 기반으로, Warp가 AI 에이전트를 위한 지속형 메모리 기능을 도입했습니다. 이 업데이트를 통해 에이전트는 다양한 하네스, 기계 및 팀원 전반에서 상태와 컨텍스트를 유지할 수 있게 되어, 협업형 장기 에이전트 워크플로우의 필요성을 해결합니다. 연구 프리뷰에는 내장된 출처 추적 및 구성 가능한 액세스 제어가 포함되어 있습니다.

  • • Warp가 AI 에이전트를 위한 지속형 메모리 기능을 연구 프리뷰로 도입했습니다.
  • • 이 기능은 Warp Agent CLI 생태계를 기반으로 상태 유지형 협업 워크플로우를 가능하게 합니다.
  • • 메모리는 에이전트 하네스, 기계 및 팀원 간에 공유됩니다.
  • • 내장된 출처 추적 및 구성 가능한 액세스 제어가 포함되어 있습니다.

이번 개발은 에이전트가 세션과 팀원 전반에 걸쳐 컨텍스트를 유지할 수 있도록 하여 Warp Agent CLI의 기능을 확장하고, 더 복잡하고 협업적인 자동화를 촉진합니다.

SOURCES

14. Warp, AI 소프트웨어 개발을 위한 Warp Factories 도입

Warp Factories는 개발자들에게 AI 소프트웨어 팩토리 생성을 간소화하도록 설계된 사전 구축된 인프라 시스템을 제공합니다. 이 시스템은 자동화된 AI 개발 파이프라인의 배포 및 확장을 간소화하여, 맞춤형 에이전트 환경을 구축하는 데 필요한 엔지니어링 오버헤드를 줄이는 것을 목표로 합니다.

  • • Warp가 AI 개발을 위한 새로운 인프라 시스템인 Warp Factories를 도입했습니다.
  • • 이 시스템은 AI 소프트웨어 팩토리 구축 과정을 간소화하도록 설계되었습니다.
  • • AI 기반 소프트웨어 생성을 간소화하기 위한 즉시 사용 가능한 인프라를 제공합니다.

개발자들은 사전 구축된 인프라를 활용하여 AI 기반 소프트웨어 개발 파이프라인을 자동화하고 확장할 수 있습니다.

SOURCES

15. Atlas Cloud, 멀티 모델 테스트를 위한 Creator Central 출시

Atlas Cloud의 Creator Central 플랫폼은 개발자가 여러 모델에서 동시에 프롬프트를 테스트할 수 있도록 하여 모델 평가를 간소화합니다. 플랫폼의 모델 탐색 도구는 단일 프롬프트를 최대 10개의 모델에서 실행하여 출력과 설정을 비교하는 과정을 간소화합니다.

  • • Atlas Cloud가 개발자의 AI 모델 테스트 및 비교를 돕기 위해 Creator Central을 출시했습니다.
  • • 모델 탐색 도구를 사용하면 사용자가 단일 프롬프트를 최대 10개의 서로 다른 모델에서 동시에 실행할 수 있습니다.
  • • 플랫폼에는 특정 프롬프트와 설정을 액세스하고 편집할 수 있는 생성기 템플릿 워크플로우가 포함되어 있습니다.
  • • Atlas Cloud는 또한 Seedance 2.5 모델의 가격 인하와 Wan3.0의 출시 예정 소식을 발표했습니다.

개발자들은 여러 탭과 스프레드시트를 관리하는 대신 실시간으로 출력을 나란히 비교하여 모델 평가 과정을 간소화할 수 있습니다.

SOURCES

16. HumanEvals 오픈소스 라이브러리, 멀티모달 평가에 인간 판단 통합

HumanEvals 오픈소스 라이브러리는 멀티모달 모델 평가 파이프라인에 인간 피드백을 통합하는 과정을 간소화합니다. 이 라이브러리는 이미지, 비디오 및 오디오 출력을 지원하여 개발자가 인간 참가자로부터 쌍별 선호도, 평가 및 순위를 빠르게 수집할 수 있도록 합니다.

  • • HumanEvals는 멀티모달 모델 평가에 인간 판단을 통합하기 위해 설계된 오픈소스 라이브러리입니다.
  • • 모델의 이미지, 비디오 및 오디오 출력 평가를 지원합니다.
  • • 개발자가 인간 참가자로부터 쌍별 선호도, 평가 및 순위를 몇 초 만에 얻을 수 있도록 합니다.

개발자들은 이미지, 비디오 및 오디오 모델 평가 파이프라인에 실제 인간 피드백을 쉽게 추가하여 정렬(alignment)을 개선할 수 있습니다.

SOURCES

17. 복합 LLM 파이프라인의 '역할 드리프트'를 방지하는 Role Anchor 방법

Role Anchor 방법은 전문 모듈이 할당된 작업을 조용히 포기하는 복합 LLM 파이프라인의 '역할 드리프트' 문제를 해결합니다. 모듈을 지정된 역할에 제한함으로써, 이 방법은 시스템 수준의 정확도 향상이 모듈이 서로 답을 제공하는 결과가 아닌 진정한 향상임을 보장합니다.

  • • 복합 LLM 파이프라인은 시스템 수준 지표는 향상을 보여도 전문 모듈이 할당된 역할을 포기하는 '역할 드리프트'를 겪습니다.
  • • 평가된 한 파이프라인에서 명백한 강화 학습 이득의 86%가 실제로는 역할 드리프트로 인한 것이었습니다.
  • • Role Anchor는 파이프라인 내에서 모듈을 할당된 역할에 제한하도록 설계된 새로운 방법입니다.
  • • 개발자가 시스템 수준 성능 지표만 모니터링할 경우 역할 드리프트는 종종 보이지 않습니다.

개발자들은 전문 파이프라인 모듈이 조용히 실패하거나 부정행위를 하는 것을 방지하여 시스템 수준의 정확도 향상이 진정한 것임을 보장할 수 있습니다.

SOURCES

18. llama.cpp, 3진 모델을 위한 CUDA 및 Vulkan 지원 병합

llama.cpp에 대한 최근 업데이트는 Ternary-Bonsai-27B에 대한 CUDA 및 Vulkan 지원을 도입했으며, 토큰 생성 속도를 높이는 CUDA 최적화가 포함되었습니다. 이 업데이트를 통해 고도로 양자화된 1비트 및 3진 모델을 소비자용 하드웨어에서 효율적으로 실행할 수 있습니다.

  • • Ternary-Bonsai-27B에 대한 CUDA 및 Vulkan 지원이 llama.cpp 메인라인에 병합되었습니다.
  • • 병합된 CUDA 최적화 PR은 토큰 생성 속도를 15~40%, 프롬프트 처리 속도를 8% 향상시킵니다.
  • • Maple-Preview 20B-A1B 모델은 Mac Mini M4에서 초당 200 토큰 이상의 속도를 달성합니다.
  • • CPU 기반 3진 양자화 및 VNNI 호환 CPU 속도 향상을 위해 여러 llama.cpp 풀 리퀘스트가 열렸습니다.

개발자들은 고도로 양자화된 1비트 및 3진 모델을 소비자용 하드웨어에서 로컬로 실행하여 엄청난 속도 향상을 얻을 수 있습니다.

SOURCES

19. llama.cpp, Ling-3.0 모델 공식 지원 추가

8월 4일 Ling-3.0-flash 모델 가중치 공개를 기반으로, llama.cpp 프로젝트가 BailingMoE3 아키텍처 지원을 공식 통합했습니다. 이 업데이트를 통해 개발자들은 최적화된 GGUF 양자화를 사용하여 Ling-3.0-tiny 및 Ling-3.0-flash 모델을 로컬에서 실행할 수 있습니다.

  • • Ling-3.0(BailingMoE3) 지원이 빌드 b10472부터 풀 리퀘스트 #26608을 통해 llama.cpp 마스터 브랜치에 병합되었습니다.
  • • Bartowski가 Ling-3.0-tiny(8B) 및 Ling-3.0-flash(127B) 모델을 위한 GGUF imatrix 양자화를 출시했습니다.
  • • Intel Arc B580 GPU에서 Ling-3.0-tiny-Q8_0을 사용한 사용자 벤치마크 결과, 프롬프트 처리 속도가 초당 120.76 토큰을 달성했습니다.
  • • 특정 구성 플래그를 사용하여 12GB VRAM에서 128K 컨텍스트 윈도우로 모델을 실행할 수 있습니다.

개발자들은 이제 최적화된 GGUF 양자화를 사용하여 Ling-3.0 모델 제품군을 로컬에 배포할 수 있으며, 이달 초 공개된 가중치의 활용도를 확장할 수 있습니다.

SOURCES

20. Anthropic, 8월 프로모션으로 Claude Code 사용 제한 확대

이전의 Claude Code 용량 조정에 이어, Anthropic은 Pro, Max, Team 및 기존 Enterprise 플랜의 주간 사용 제한을 50% 자동으로 높이는 새로운 프로모션을 도입했습니다. 모든 플랫폼에 적용되는 이 증가분은 2026년 8월 31일까지 유효하며, 이전 업데이트에서 제공된 용량을 더욱 확장합니다.

  • • 2026년 8월 31일까지 유효한 Claude Code 주간 사용 제한 50% 확대.
  • • Pro, Max, Team 및 기존 Enterprise 플랜에 적용됩니다.
  • • CLI, IDE 확장, 데스크톱 및 웹 플랫폼을 포함합니다.
  • • 무료 플랜 및 소비 기반 Enterprise 좌석은 제외됩니다.

이번 프로모션은 Claude Code를 위해 이전에 구현된 인프라 및 제한 업데이트를 기반으로, 8월 남은 기간 동안 개발자들에게 코딩 용량을 추가로 제공합니다.

SOURCES

21. OpenRouter, OpenAI의 GPT-5.6 Sol 가격 인하 반영

8월 17일 OpenAI의 GPT-5.6 Sol 모델에 대한 표준 API 가격 50% 인하에 따라, OpenRouter는 플랫폼을 업데이트하여 배치, 플렉스 및 우선순위 티어 전반에 걸쳐 동일한 50% 할인을 제공합니다. 이를 통해 OpenRouter의 라우팅 인프라를 사용하는 개발자들은 주력 모델에 대한 더 낮은 비용의 혜택을 즉시 누릴 수 있습니다.

  • • OpenRouter가 GPT-5.6 Sol에 대해 OpenAI의 50% 가격 인하를 동일하게 적용했습니다.
  • • 할인은 OpenRouter의 배치, 플렉스 및 우선순위 티어에 적용됩니다.
  • • 이는 8월 17일 발표된 OpenAI의 공식 가격 인하에 따른 것입니다.

이번 업데이트는 최근 업계 전반의 GPT-5.6 Sol 가격 인하가 타사 애그리게이터 전반에 반영되고 있음을 확인시켜 주며, 프로덕션 규모의 에이전트 워크플로우 비용을 더욱 낮춰줍니다.

SOURCES

22. Snowflake Cortex AI Gateway, 동적 모델 라우팅 추가

Snowflake는 AI 에이전트를 위한 중앙 집중식 거버넌스 및 보안을 제공하기 위해 7월에 출시된 Cortex AI Gateway의 기능을 확장하여 동적 모델 라우팅을 추가했습니다. 이 업데이트를 통해 게이트웨이는 어드바이저 패턴과 과거 작업 데이터를 사용하여 작업을 가장 비용 효율적인 모델로 자동 전달하며, 보안 경계를 유지하면서 토큰 비용을 최대 3배까지 절감할 수 있습니다.

  • • Snowflake가 에이전트 거버넌스를 위해 출시된 Cortex AI Gateway에 동적 모델 라우팅을 추가했습니다.
  • • 새로운 라우팅 기능은 어드바이저 패턴과 과거 작업 분류를 사용하여 모델 선택을 최적화합니다.
  • • 이 업데이트는 간단한 작업을 더 작은 모델로 오프로드하여 토큰 비용을 최대 3배까지 절감할 수 있습니다.
  • • 서비스는 고객의 지역 보안 경계 내에 유지되며 추가 비용 없이 포함됩니다.
  • • 게이트웨이는 DeepSeek-V4-Flash 및 GLM-5.3과 같은 오픈 모델을 지원합니다.

이번 업데이트는 자동화된 비용 최적화를 추가하여 게이트웨이의 기존 거버넌스 프레임워크를 기반으로 하며, 개발자가 단일 플랫폼 내에서 보안과 추론 비용을 모두 관리할 수 있도록 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.