Inference Brew

OpenAI, 105만 토큰 컨텍스트와 컴퓨터 사용 기능을 갖춘 GPT-6 Astra 출시

00:00 / --:--

← 메인으로

OpenAI, 105만 토큰 컨텍스트와 컴퓨터 사용 기능을 갖춘 GPT-6 Astra 출시

1. OpenAI, 105만 토큰 컨텍스트와 컴퓨터 사용 기능을 갖춘 GPT-6 Astra 출시

OpenAI는 컴퓨터 사용 및 소프트웨어 엔지니어링 작업에 최적화된 차세대 모델 GPT-6 Astra를 출시했습니다. Astra는 압축 방식 대신 새로운 메모 기록 방식을 사용하여 윈도우 전반의 상태를 관리하는 105만 토큰 컨텍스트 윈도우를 도입했습니다. 호스팅 RAM을 절약하기 위해 레이어를 재사용하는 루프형 트랜스포머 아키텍처를 기반으로 구축되었으며, 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러입니다. 현재 Daybreak Access 회원, ChatGPT 유료 티어, OpenAI API 및 AWS를 통해 순차적으로 배포되고 있습니다.

  • • GPT-6 Astra는 105만 토큰의 컨텍스트 윈도우와 12만 8천 토큰의 최대 출력 제한을 제공합니다.
  • • API 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러이며, 캐시된 읽기에 대해 90% 할인이 적용됩니다.
  • • 이 모델은 DeepSWE v1.1 벤치마크에서 74.1%, Provider Adapter 하네스를 사용한 ARC-AGI-3에서 99.9%의 점수를 기록했습니다.
  • • Astra는 루프형 트랜스포머 아키텍처를 활용하여 저장 공간이나 RAM 요구 사항을 늘리지 않고도 용량을 확장합니다.
  • • 이 모델은 OpenAI의 중요 사이버 보안 임계값에 도달한 것으로 지정되어 일반 사용자의 고급 익스플로잇 발견 기능이 제한됩니다.

개발자들은 기본 API 가격은 높지만, 작업당 토큰 사용량을 획기적으로 줄여주는 고도로 발전된 컴퓨터 사용 및 코딩 모델을 사용할 수 있게 되었습니다.

2. Meta, Muse Spark 1.3 성능 및 기여자 가격 정책 상세 공개

Meta는 어제 출시된 Muse Spark 1.3 모델에 대한 추가 세부 정보를 제공하며, 100만 토큰 컨텍스트 윈도우와 향상된 효율성을 강조했습니다. 이 모델은 버전 1.2 대비 도구 호출을 20%, 토큰 사용량을 25% 줄였습니다. 또한 Meta는 향후 모델 학습을 돕기 위해 프롬프트와 출력 데이터를 공유하기로 선택한 사용자에게 95% 할인을 제공합니다.

  • • Muse Spark 1.3은 100만 토큰 컨텍스트 윈도우를 특징으로 합니다.
  • • 효율성 개선 사항으로 도구 호출 20% 감소 및 토큰 사용량 25% 감소가 포함됩니다.
  • • 이 모델은 DeepSWE v1.1 벤치마크에서 75.4점을 기록했습니다.
  • • 모델 학습을 위한 데이터 공유에 동의한 사용자에게 95% 할인이 제공됩니다.
  • • 최고 수준의 추론 모드는 안전성 테스트를 위해 여전히 제한되어 있습니다.

개발자들은 새로 공개된 기여자 프로그램을 통해 모델의 효율성 향상과 비용 절감 기회를 평가할 수 있게 되었습니다.

3. IFM, 512K 컨텍스트를 지원하는 오픈 웨이트 모델 제품군 K2 Horizon 출시

MBZUAI의 IFM은 6개의 오픈 웨이트 모델로 구성된 K2 Horizon을 출시했습니다. 이 모델은 전체 학습 수명 주기, 중간 체크포인트, 학습 데이터 레시피 및 xLLM 학습 인프라를 제공하여 높은 투명성을 자랑합니다. 모델은 경량급 0.9B 변형부터 대규모 375B-A23B 희소 Mixture-of-Experts(MoE) 모델까지 다양합니다. 36B-A4B 모델은 활성 파라미터를 최적화하기 위해 MoVA(Mixture-of-Value-Attention) 메커니즘을 도입했으며, 대형 모델은 기본적으로 512K 토큰 컨텍스트 윈도우를 지원합니다.

  • • K2 Horizon 제품군은 375B-A23B, 36B-A4B, 32B, 7B, 3.7B, 0.9B 변형 등 6개 모델을 포함합니다.
  • • 모델은 Apache 2.0 라이선스로 출시되며 중간 체크포인트, 학습 데이터 레시피 및 코드가 완전히 오픈 소스로 공개됩니다.
  • • 36B-A4B 및 375B-A23B 모델은 MoE 아키텍처를 사용하며, 36B 모델은 새로운 MoVA 메커니즘을 특징으로 합니다.
  • • 모델은 최대 524,288 토큰의 기본 컨텍스트 윈도우를 지원합니다.
  • • vLLM, SGLang, Ollama를 통해 NVIDIA, AMD, Cerebras 하드웨어에서 즉시 배포를 지원합니다.

개발자들은 512K의 방대한 컨텍스트 윈도우를 갖춘 고성능 완전 오픈 웨이트 모델 제품군을 사용할 수 있으며, vLLM, SGLang, Ollama에서 즉시 지원됩니다.

4. Microsoft, 가격 72% 인하한 MAI-Transcribe-2 출시

2026년 6월에 도입된 MAI-Transcribe-1.5 모델을 기반으로 Microsoft가 MAI-Transcribe-2를 출시했습니다. 이 새로운 모델은 가격을 시간당 0.10달러로 72% 인하하고 처리 속도를 실시간 대비 411배로 높였으며, 정확도를 2.0% 단어 오류율(WER)로 개선했습니다. 현재 Microsoft Foundry와 MAI Playground를 통해 사용할 수 있습니다.

  • • MAI-Transcribe-2의 가격은 시간당 0.10달러로, MAI-Transcribe-1.5의 1,000분당 6달러 대비 72% 인하되었습니다.
  • • 이 모델은 2.0%의 단어 오류율을 달성하여 이전 모델의 2.4%보다 개선되었습니다.
  • • 처리 속도는 이전 버전의 276배에서 411배로 증가했습니다.
  • • 새로운 기능으로 60개 언어 지원, 화자 분리(diarization), 단어 단위 타임스탬프가 포함됩니다.
  • • Microsoft Foundry와 MAI Playground를 통해 지금 바로 이용 가능합니다.

이번 업데이트는 이전 세대와 비교하여 Microsoft의 독점 전사 모델을 사용하는 개발자들의 비용과 지연 시간을 크게 낮춰줍니다.

5. Inworld, Realtime TTS-2 정식 출시

Inworld는 Realtime TTS-2 모델을 연구 프리뷰에서 정식 상용 버전으로 전환했습니다. 100개 이상의 언어와 일반 텍스트 스타일 지침을 지원하는 이 모델은 Artificial Analysis Controlled Voice Arena에서 Elo 점수 1,123점으로 1위를 차지했습니다. 개발자들은 100만 문자당 20.83달러의 가격으로 이용할 수 있습니다.

  • • Realtime TTS-2는 초기 연구 프리뷰를 거쳐 정식 출시되었습니다.
  • • 모델 가격은 100만 문자당 20.83달러입니다.
  • • Artificial Analysis Controlled Voice Arena에서 Elo 점수 1,123점으로 1위를 기록했습니다.
  • • 자동 언어 감지를 포함하여 100개 이상의 언어를 지원합니다.
  • • 초당 106자의 생성 처리량을 달성합니다.

개발자들은 이제 초당 106자 처리량으로 고품질 다국어 음성 생성을 제공하는 프로덕션 준비 완료 모델을 사용할 수 있습니다.

SOURCES

6. Alibaba, 비디오 생성 및 편집 모델 Wan 3.0 출시

Alibaba는 비디오 생성 모델 제품군의 주요 업그레이드인 Wan 3.0을 출시했습니다. 이 모델은 기본 오디오와 함께 최대 30초 분량의 1080p 비디오를 생성할 수 있습니다. 텍스트, 이미지, 오디오, 웹 페이지 등 다양한 창의적 입력을 지원하며, 시각적 요소, 줄거리, 대화, 사운드에 대한 지침 기반 편집이 가능합니다. Wan 3.0은 현재 Alibaba Cloud Model Studio에서 공개 프리뷰 중입니다.

  • • Wan 3.0은 기본 오디오와 함께 최대 30초의 1080p 비디오를 생성합니다.
  • • 텍스트-비디오, 이미지-비디오, 참조 기반 생성 및 지침 기반 편집을 지원합니다.
  • • Artificial Analysis Video Arena에서 오디오 포함 비디오 편집 부문 1위, 오디오 포함 텍스트-비디오 부문 2위를 차지했습니다.
  • • 가격은 480p 초당 0.05달러, 720p 초당 0.10달러, 1080p 초당 0.20달러부터 시작합니다.
  • • Alibaba Cloud Model Studio를 통해 공개 프리뷰로 제공됩니다.

개발자들은 Alibaba Cloud Model Studio를 통해 스타일 전송 및 동작 보존을 포함한 고급 비디오 편집 및 생성 기능을 직접 통합할 수 있습니다.

SOURCES

7. sanoTTS, 마이크로컨트롤러용 초경량 신경망 TTS 스택 출시

한 개발자가 저사양 하드웨어용으로 설계된 초경량 신경망 텍스트-음성 변환 스택인 sanoTTS를 출시했습니다. 모델 제품군은 294k에서 220만 파라미터까지 다양하며, 가장 작은 모델은 int8로 양자화 시 337kb에 불과합니다. 작은 크기에도 불구하고 1.5M 모델은 3달러짜리 ESP32 마이크로컨트롤러에서 0.225의 실시간 계수(RTF)로 실행되어 1초 이내에 4초 분량의 오디오를 생성합니다.

  • • sanoTTS는 294k에서 2.2M 파라미터 범위의 모델 크기로 11개의 음성과 6개 언어를 지원합니다.
  • • 294k 모델은 int8 양자화 시 337kb를 차지하며 512kb SRAM을 가진 3달러짜리 칩에서 실행됩니다.
  • • 1.5M 모델은 ESP32 마이크로컨트롤러에서 0.225의 실시간 계수를 달성하여 1초 만에 4초 분량의 오디오를 생성합니다.
  • • 모델 제품군은 `sanotts-web` npm 패키지를 통해 웹 애플리케이션에서 사용할 수 있습니다.
  • • 개발자는 sanoTTS가 지금까지 만들어진 가장 작은 신경망 TTS 모델이라고 주장합니다.

개발자들은 NPU 없이도 저비용 엣지 하드웨어 및 마이크로컨트롤러에서 고품질 로컬 텍스트-음성 변환 기능을 직접 배포할 수 있습니다.

SOURCES

8. Anthropic, Claude Commerce Agents 참조 블루프린트 출시

Anthropic은 쇼핑 및 상거래 에이전트 구축을 위한 오픈 소스 참조 블루프린트인 `anthropics/commerce-agents`를 출시했습니다. 이 저장소는 소매, 여행, 통신, 엔터테인먼트라는 4개 수직 분야에 대한 실행 가능한 구현을 제공합니다. 성능 최적화를 위해 Anthropic은 지연 시간과 API 비용을 최소화하는 데 도움이 되는 기존 인텐트 라우터 대신 '에이전트 스킬' 아키텍처를 권장합니다. 또한 이 시스템은 모델이 작업을 제안하고 하네스가 이를 적용하는 승인 게이트를 활용합니다.

  • • `anthropics/commerce-agents` 저장소는 Apache 2.0 라이선스로 출시되었습니다.
  • • 블루프린트에는 Python 3.11+ 및 Node 22에서 실행되는 소매, 여행, 통신, 엔터테인먼트 분야의 실행 가능한 구현이 포함되어 있습니다.
  • • Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI를 통한 배포를 지원합니다.
  • • 아키텍처는 지연 시간과 토큰 비용을 최소화하기 위해 인텐트 라우터 대신 '에이전트 스킬' 설계를 사용합니다.
  • • 에이전트 구현을 구성하고 검토하기 위한 Claude Code 플러그인이 포함되어 있습니다.

개발자들은 지연 시간과 토큰 비용을 최소화하는 사전 구축된 최적화된 스킬 아키텍처를 사용하여 프로덕션 준비가 완료된 상거래 에이전트를 빠르게 구성하고 배포할 수 있습니다.

SOURCES

9. Cursor 클라우드 에이전트, 이제 프라이빗 네트워크 내 실행 지원

8월 20일에 도입된 이벤트 기반 클라우드 에이전트에 이어, Cursor는 이러한 에이전트가 프라이빗 네트워크에서 실행될 수 있도록 인프라 지원을 확장했습니다. 이전에는 에이전트가 Cursor의 표준 클라우드 환경으로 제한되었으나, 이제 개발 팀이 직접 관리하는 머신 풀에 동적으로 예약할 수 있게 되어 내부 서비스 및 프라이빗 소스 제어에 대한 안전한 액세스가 가능해졌습니다.

  • • Cursor 클라우드 에이전트는 이제 프라이빗한 사용자 관리 머신 풀에서의 실행을 지원합니다.
  • • 이는 8월에 도입된 이벤트 기반 에이전트 기능을 확장한 것입니다.
  • • 에이전트는 이제 내부 서비스 및 프라이빗 소스 제어 시스템에 직접 액세스할 수 있습니다.
  • • 에이전트는 표준 Cursor 플랫폼을 통해 계속해서 시작 및 관리됩니다.

이번 업데이트를 통해 팀은 이전에는 클라우드 호스팅 에이전트가 접근할 수 없었던 내부 데이터베이스, 사용자 지정 빌드 파이프라인, 프라이빗 소스 제어 시스템과 Cursor의 에이전트 워크플로우를 통합할 수 있습니다.

SOURCES

10. Restless 출시, AI 에이전트의 API 상호작용 생성 및 디버깅 지원

Restless는 AI 에이전트가 API와 상호작용하는 방식을 간소화하기 위해 설계된 개발자 도구입니다. 이 플랫폼은 기존 엔드포인트에서 API 문서를 자동으로 생성하여 에이전트가 호출 방법을 더 쉽게 이해하도록 합니다. 결정적으로 Restless에는 실패한 API 호출을 가로채고 수정 지침을 생성하여 에이전트가 실시간으로 스스로 수정하고 요청을 재시도할 수 있도록 하는 오류 처리 메커니즘이 포함되어 있습니다.

  • • Restless는 에이전트 통합을 돕기 위해 기존 엔드포인트에서 API 문서를 자동으로 생성합니다.
  • • 이 도구는 실패한 API 호출을 포착하고 에이전트에게 재시도 지침을 제공하는 오류 처리 루프를 특징으로 합니다.
  • • 실시간 API 로그를 통해 개발자는 고객 활동을 호출별로 모니터링할 수 있습니다.
  • • 개발자는 `npx restless init`을 실행하여 로컬에서 도구를 초기화할 수 있습니다.

개발자들은 Restless가 실패한 API 호출을 포착하고 에이전트에게 수정 지침을 다시 제공하도록 함으로써 더 탄력적인 에이전트 통합을 구축할 수 있습니다.

SOURCES

11. Nvidia, 로컬 AI 추론을 위해 유휴 컴퓨터를 연결하는 PAIR 출시

Nvidia는 유휴 컴퓨터를 통합된 로컬 AI 추론 풀로 네트워크화하도록 설계된 무료 오픈 소스 도구인 PAIR(Personal AI Router)를 출시했습니다. Windows, Linux, macOS와 호환되는 PAIR는 Nvidia RTX GPU, DGX Spark 시스템 및 Apple M4 칩을 지원합니다. 이 소프트웨어는 상호 TLS(mTLS)를 사용하여 통신을 보호하고 장치가 네트워크에 참여하거나 나갈 때 동적으로 확장되므로 개발자가 여러 머신에서 로컬 모델을 실행할 수 있습니다.

  • • PAIR는 유휴 가정용 컴퓨터를 연결하여 로컬 AI 추론을 병렬로 수행하는 무료 오픈 소스 도구입니다.
  • • 이 소프트웨어는 Nvidia GeForce RTX 20 시리즈 이상, RTX Pro, DGX Spark 및 Apple M4 칩 이상과 호환됩니다.
  • • PAIR는 활성 작업에 방해가 되지 않도록 네트워크에 참여하거나 나가는 장치에 자동으로 조정됩니다.
  • • 연결은 6자리 페어링 코드와 상호 TLS(mTLS) 암호화를 사용하여 보호됩니다.
  • • Nvidia는 또한 Perplexity Portable Computer, Hermes Agent, OpenClaw와 같은 에이전트 애플리케이션을 위한 간소화된 로컬 설정을 발표했습니다.

개발자들은 클라우드 GPU 비용을 지불하지 않고도 여러 로컬 머신의 컴퓨팅 파워를 활용하여 더 큰 모델을 실행하거나 로컬 추론 속도를 높일 수 있습니다.

SOURCES

12. ik_llama.cpp, Qwen4exp에 대한 다중 토큰 예측(MTP) 지원 추가

Qwen3.6에서 MTP 성능 향상으로 주목받았던 ik_llama.cpp 프로젝트가 Qwen4exp 모델에 대한 MTP 지원을 병합하여 기능을 확장했습니다. 이 업데이트를 통해 2.6B MTP 헤드를 사용하여 토큰을 초안 작성하고 검증할 수 있게 되었으며, 출력 패리티를 유지하면서 호환되는 하드웨어에서 추론 속도를 두 배로 높였습니다.

  • • ik_llama.cpp의 PR #2369는 Qwen4exp에 대한 MTP 지원을 추가합니다.
  • • 초안 작성 및 검증을 위해 2.6B MTP 헤드를 사용합니다.
  • • 초안 수락률은 코드의 경우 93-99%, 산문의 경우 60-65%에 달합니다.
  • • RTX 5090에서의 성능은 초당 90토큰에 도달합니다.
  • • 멀티 GPU 지원 없이 단일 슬롯 작업으로 제한됩니다.

개발자들은 이제 더 새로운 Qwen4exp 아키텍처에 대해 MTP 기반 속도 향상을 활용할 수 있으며, 프로젝트에서 이전에 관찰된 성능 이점을 확장할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.