Inference Brew

Ox Alpha, GLM-5.3-Flash로 밝혀져... 초저가 API 제공

00:00 / --:--

← 메인으로

Ox Alpha, GLM-5.3-Flash로 밝혀져... 초저가 API 제공

1. Ox Alpha, GLM-5.3-Flash로 밝혀져... 초저가 API 제공

최근 OpenRouter에서 화제가 되었던 익명의 'Ox Alpha' 모델이 공식적으로 GLM-5.3-Flash로 확인되었습니다. 18B 활성 파라미터를 가진 320B Mixture-of-Experts(MoE) 모델로 설계된 이 모델은 초저비용 추론을 위해 최적화되었습니다. 코딩 및 에이전트 벤치마크에서 Claude Opus 4.8과 같은 대형 모델에 근접하는 성능을 제공하면서도, 입력 토큰 100만 개당 15센트라는 저렴한 비용을 자랑합니다.

  • • GLM-5.3-Flash는 18B 활성 파라미터를 가진 320B MoE 모델로, 이전에는 'Ox Alpha'라는 이름으로 익명 테스트되었습니다.
  • • 가격은 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.50달러이며, 9월 9일까지 50% 할인이 적용됩니다.
  • • 중국 AI 인프라에서 구동되며 코딩 및 에이전트 벤치마크에서 Claude Opus 4.8 수준의 성능을 보이는 것으로 알려졌습니다.

개발자들은 100만 입력 토큰당 0.15달러라는 저렴한 비용으로 최첨단 모델에 버금가는 코딩 및 에이전트 모델을 사용할 수 있게 되었습니다.

2. Google, Gemini Omni Flash 1.1 업데이트... 향상된 비디오 생성 API 제공

Gemini Omni Flash의 초기 출시를 바탕으로 Google은 Gemini API에 전문가급 창의적 제어 기능을 추가한 1.1 버전을 출시했습니다. 이번 업데이트를 통해 개발자는 기존 비디오를 최대 40초까지 확장하고, 60% 더 빠른 360p 미리보기 모드를 활용하며, 출력을 1080p 또는 4K로 업스케일링할 수 있습니다.

  • • Gemini Omni 1.1 Flash는 이제 Google AI Studio 및 Gemini Enterprise Agent Platform의 Gemini API를 통해 사용할 수 있습니다.
  • • 새로운 장면 확장 기능을 통해 비디오를 10초 단위로 최대 40초까지 확장할 수 있습니다.
  • • 최적화된 360p 미리보기 모드는 720p 생성보다 60% 빠르며 비용은 3분의 1 수준입니다.
  • • 생성된 비디오 출력을 1080p 또는 4K로 업스케일링하는 기능을 지원합니다.

이번 업데이트는 Gemini Omni Flash의 비디오 기능을 초기 릴리스에서 비디오 편집 및 품질 관리를 위한 특정 도구를 갖춘 보다 강력하고 프로덕션 준비가 완료된 제품군으로 전환합니다.

SOURCES

3. Apodex, 1.1 모델 제품군 및 FrontierAgent 하네스 출시

Apodex는 추론, 코드 실행, 다중 에이전트 조정과 같은 작업 전반에서 에이전트 지능을 확장하도록 특별히 최적화된 Apodex 1.1 모델 제품군을 발표했습니다. 이번 릴리스에는 다양한 하드웨어 제약 조건을 수용하기 위한 4가지 양자화 버전(mini, NVFP4, GPTQ-Int4, FP8)이 포함되어 있습니다. 모델과 함께 Apodex는 GitHub에서 FrontierAgent 에이전트 하네스를 오픈소스로 공개하고 FrontierChallenge 벤치마크 논문을 발표했습니다.

  • • Apodex 1.1 제품군에는 Apodex-1.1-mini, Apodex-1.1-mini-NVFP4, Apodex-1.1-mini-GPTQ-Int4, Apodex-1.1-mini-FP8의 4가지 버전이 포함됩니다.
  • • 이 모델들은 추론, 검색, 파일 처리, 장애 복구를 위한 에이전트 지능을 확장하도록 설계되었습니다.
  • • Apodex는 FrontierAgent 에이전트 하네스를 GitHub에 오픈소스로 공개했습니다.

개발자들은 여러 양자화 형식으로 제공되는 에이전트 최적화 모델 제품군과 추론 및 다중 에이전트 조정을 확장할 수 있는 오픈소스 하네스를 얻게 되었습니다.

SOURCES

4. Meta, 검색 기반의 Muse 이미지 모델 도입

Meta는 렌더링 전에 추론 단계를 수행하도록 설계된 새로운 이미지 생성 모델 Muse Image를 출시했습니다. 이 모델은 정확도와 문맥적 관련성을 높이기 위해 검색 결과를 바탕으로 이미지를 생성한다는 점이 특징입니다. Muse Image는 이미지당 0.01달러라는 경쟁력 있는 가격으로 프로덕션 환경에서 사용할 수 있습니다.

  • • Muse Image는 이미지를 렌더링하기 전에 추론 단계를 수행하여 프롬프트와의 높은 일치성을 보장합니다.
  • • 이 모델은 실시간 검색 결과를 사용하여 이미지 생성 과정을 뒷받침합니다.
  • • 프로덕션 규모의 볼륨에 대해 이미지당 0.01달러의 가격이 책정되었습니다.

개발자들은 실시간 검색 데이터를 기반으로 하는 정확하고 문맥을 이해하는 이미지를 저렴한 비용으로 생성할 수 있습니다.

SOURCES

5. WeChat, WeMM-Embedding 멀티모달 모델 제품군 출시

WeChat은 멀티모달 임베딩 모델 제품군인 WeMM-Embedding을 오픈소스로 공개했습니다. 이 모델들은 텍스트, 이미지, 비디오, 시각적 문서, 인터리브 미디어를 포함한 다양한 입력을 단일 통합 표현 공간으로 매핑하도록 설계되었습니다. 이를 통해 개발자는 미디어 유형별로 별도의 임베딩 파이프라인을 구축할 필요 없이 고급 멀티모달 RAG(검색 증강 생성) 및 검색 시스템을 구축할 수 있습니다.

  • • WeMM-Embedding은 WeChat이 오픈소스로 공개한 멀티모달 임베딩 모델 제품군입니다.
  • • 이 모델들은 텍스트, 이미지, 비디오, 시각적 문서 및 인터리브 입력을 단일 표현 공간으로 매핑합니다.
  • • 저장소는 개발자 통합을 위해 GitHub에서 공개적으로 사용할 수 있습니다.

개발자들은 단일 임베딩 공간을 사용하여 비디오 및 시각적 문서를 포함한 여러 모달리티 전반에서 통합된 벡터 검색 및 검색 시스템을 구축할 수 있습니다.

SOURCES

6. H3 Max, 실시간 AI 비디오 생성 기능 구현

7월에 출시된 H3 멀티모달 모델을 기반으로, H3 Max 도구가 실시간 비디오 생성이라는 새로운 성능 이정표에 도달했습니다. 이제 사용자는 비디오 재생 시간보다 짧은 시간 내에 복잡한 비디오 시퀀스를 생성할 수 있어 생성형 비디오 애플리케이션의 지연 시간을 크게 줄일 수 있습니다.

  • • H3 Max는 이제 비디오 재생 시간보다 빠른 실시간 비디오 생성을 지원합니다.
  • • 이번 개발은 7월에 있었던 H3 멀티모달 모델의 초기 릴리스에 이은 것입니다.
  • • 이 도구에는 고품질 출력을 지원하기 위한 자동 프롬프트 향상 기능이 포함되어 있습니다.

이러한 성능 향상을 통해 개발자는 실시간 비디오 생성을 애플리케이션에 통합하여 즉각적인 시각적 피드백을 제공할 수 있습니다.

SOURCES

7. Manycore Tech, Lux3D 생성 모델 출시

Manycore Tech는 빠른 자산 생성을 위해 설계된 새로운 3D 생성 모델 Lux3D를 출시했습니다. 이 모델은 20초 만에 고품질 재질이 적용된 완전한 텍스처 3D 객체를 생성할 수 있습니다. 또한 비용 효율적인 배치 생성을 위해 생성 프로세스를 최적화하는 전용 'Harness Mode'를 갖추고 있어 3D 자산 파이프라인을 확장해야 하는 개발자에게 매우 적합합니다.

  • • Lux3D는 20초 만에 재질과 텍스처가 포함된 고품질 3D 콘텐츠를 생성합니다.
  • • 이 모델에는 비용 효율적인 배치 자산 생성을 위해 특별히 설계된 'Harness Mode'가 포함되어 있습니다.
  • • 이 모델은 Manycore Tech에서 개발 및 출시했습니다.

3D, 게임 또는 공간 애플리케이션을 구축하는 개발자는 텍스처가 적용된 3D 자산을 거의 실시간으로 생성하고 Harness Mode를 통해 비용 효율적인 배치 생성을 실행할 수 있습니다.

SOURCES

8. Qwen4 아키텍처 세부 정보: 51B 파라미터 N-Gram 임베딩 공개

어제 발표된 Qwen4 아키텍처의 미리보기를 바탕으로, 새로운 기술 세부 정보에 따르면 이 모델은 2~3자 조각으로 인덱싱된 51B 파라미터의 별도 임베딩을 통합할 예정입니다. 이 설계를 통해 125B 파라미터 모델은 6B의 활성 파라미터 수를 유지하면서 정적 암기를 룩업 테이블로 오프로드하여 추론 용량을 우선시할 수 있습니다.

  • • Qwen4의 아키텍처는 기존 MoE 전문가를 추가하는 대신 51B 파라미터의 별도 임베딩을 활용합니다.
  • • 이 모델은 추론 중에 총 125B 파라미터 중 6B 파라미터를 활성화합니다.
  • • 별도의 임베딩은 2~3자 조각을 사용하여 인덱싱됩니다.

이러한 아키텍처 전환을 통해 모델은 정적 암기를 저렴한 룩업 테이블로 오프로드하고, 활성 파라미터를 추론을 위해 자유롭게 사용할 수 있습니다.

SOURCES

9. AI 에이전트, llms.txt 파일을 통해 소유되지 않은 코드 실행 발견

이스라엘의 한 스텔스 스타트업 보안 연구원들이 AI 에이전트가 웹사이트 문서를 파싱하는 방식에서 치명적인 취약점을 발견했습니다. 6,000개 이상의 도메인을 스캔한 결과, AI를 위한 기계 판독 가능 요약을 제공하기 위해 의도된 120개의 llms.txt 및 llms-full.txt 파일이 등록되지 않은 코드 패키지나 도메인을 가리키고 있음을 확인했습니다. 연구원들이 이러한 이름을 등록함으로써 Claude, Codex, Hermes를 포함한 인기 에이전트들이 자동으로 코드를 실행하고 서버에 연결한다는 사실을 확인했으며, 이는 에이전트가 공급업체 문서를 절대적인 진실로 취급하는 깨진 신뢰 모델을 강조합니다.

  • • 연구원들은 스캔된 6,214개의 도메인에서 등록되지 않은 코드 패키지나 도메인 이름을 가리키는 120개의 llms.txt 파일을 발견했습니다.
  • • Claude, Codex, Hermes를 포함한 AI 에이전트들은 이름이 등록된 후 코드를 실행하고 연구원들의 서버에 연결했습니다.
  • • 현재 최소 한 곳의 잘못 구성된 웹사이트가 이러한 파일을 통해 방문자를 실시간 악성 코드로 유도하고 있습니다.

외부 웹사이트를 파싱하는 에이전트를 구축하는 개발자는 에이전트가 기계 판독 가능 문서에 숨겨진 악성 코드를 실행하지 못하도록 엄격한 검증을 구현해야 합니다.

SOURCES

10. Anthropic, 물리적 장치 제어를 위한 모델 하드웨어 표준 미리보기

소프트웨어 중심의 모델 컨텍스트 프로토콜(Model Context Protocol)에 이어, Anthropic은 모델 하드웨어 표준(MHS)의 연구 미리보기를 출시했습니다. 이 새로운 프레임워크는 AI 에이전트가 현미경, 로봇 팔, 제조 기계와 같은 물리적 하드웨어와 인터페이스할 수 있도록 하는 표준화된 드라이버를 제공합니다. MHS를 MCP와 결합함으로써 개발자는 여러 물리적 기기를 병렬로 오케스트레이션하여 하드웨어 통합 시간을 몇 주에서 몇 분으로 단축하는 동시에 내장된 안전 가드레일을 유지할 수 있습니다.

  • • 모델 하드웨어 표준(MHS)은 물리적 장치를 AI 에이전트가 검색하고 해석할 수 있도록 표준화된 드라이버를 제공합니다.
  • • MHS는 모델 컨텍스트 프로토콜(MCP)과 통합되어 자연어 제어 및 자율 오류 복구를 가능하게 합니다.
  • • 초기 통합 파트너로는 AWS, Raspberry Pi, Hugging Face, Universal Robots, Doosan Robotics가 있습니다.

개발자들은 이 표준을 모델 컨텍스트 프로토콜과 함께 사용하여 자연어를 통해 물리적 실험 장비, 로봇 공학 및 제조 하드웨어를 제어하는 에이전트를 구축할 수 있습니다.

11. OpenAI, ChatGPT 사이트 및 데스크톱 앱에 WebMCP 지원 추가

OpenAI는 6월 2일에 처음 도입된 Sites 플랫폼의 기능을 확장하여 ChatGPT 데스크톱 애플리케이션과 ChatGPT Sites 모두에 WebMCP 지원을 통합했습니다. 이 업데이트를 통해 ChatGPT와 Codex는 호환되는 웹사이트 도구와 직접 상호 작용할 수 있어 수동 인터페이스 탐색이 필요하지 않게 되었습니다. OpenAI는 현재 웹 개발 팀이 이러한 에이전트 기반 브라우징 경험을 지원하도록 사이트를 설계하고 테스트할 것을 권장하고 있습니다.

  • • WebMCP 지원이 이제 ChatGPT 데스크톱 앱과 ChatGPT Sites에 통합되었습니다.
  • • 이번 업데이트는 6월 2일에 출시된 Sites 플랫폼을 기반으로 합니다.
  • • WebMCP를 사용하면 AI 에이전트가 인터페이스를 수동으로 탐색하는 대신 웹사이트 도구와 직접 상호 작용할 수 있습니다.
  • • OpenAI는 웹사이트 팀이 사용자가 에이전트 역할을 수행하는 것을 지원하기 위해 에이전트 경험을 설계하고 테스트할 것을 권장합니다.

이번 통합은 Sites 플랫폼을 정적 호스팅 도구에서 AI 에이전트가 웹 기반 서비스에서 프로그래밍 방식으로 작업을 실행할 수 있는 대화형 환경으로 발전시킵니다.

SOURCES

12. 오픈소스 Rust 모델 게이트웨이, 제로 마크업으로 출시

자체 호스팅, 오픈소스 및 최첨단 모델을 단일 고동시성 제어 평면에서 관리하도록 설계된 Rust로 작성된 새로운 오픈소스 모델 게이트웨이가 출시되었습니다. 이 게이트웨이는 최소한의 오버헤드(BYOK 요청의 경우 1ms 미만)를 추가하며 스트리밍, 도구 호출, 속도 제한 및 오류 처리와 같은 복잡한 구성을 처리합니다. 1,000개 이상의 모델을 지원하고 OTel 추적을 통합하며, 프롬프트 임베딩에 LLM 판사와 최근접 이웃 분류기를 사용하여 요청을 최적의 모델로 동적으로 라우팅합니다.

  • • 이 게이트웨이는 Rust로 작성되었으며 고동시성을 위해 구축되었고 2ms 미만의 지연 시간을 추가합니다.
  • • 1,000개 이상의 모델을 지원하며 스트리밍 형식, 도구 호출, 속도 제한 및 오류 동작을 처리합니다.
  • • 이 프로젝트는 오픈소스이며 제로 마크업을 청구하고 자체 호스팅하거나 호스팅된 버전을 통해 사용할 수 있습니다.

개발자들은 여러 공급업체에 걸쳐 LLM 요청을 라우팅, 로드 밸런싱 및 추적하기 위해 자체 인프라에 고동시성, 저지연 게이트웨이를 배포할 수 있습니다.

SOURCES

13. Visa, Nvidia의 Open Secure AI Alliance에 VVAH 보안 하네스 기여

Visa는 이전에 오픈소스로 공개했던 취약점 하네스를 Visa Vulnerability Adaptation Harness(VVAH)로 브랜드화하고 자동 수정 생성 및 검증 기능을 포함하도록 업데이트했습니다. 에이전트 보안 파이프라인의 초기 릴리스를 바탕으로, Visa는 현재 Nvidia의 Open Secure AI Alliance 및 Project Lightwell과 협력하여 도구를 더욱 발전시키고 있습니다. VVAH는 모델에 구애받지 않으며, 패치 검토 및 배포를 위한 인간의 감독을 지속적으로 강조하면서 11단계에 걸쳐 보안 워크플로우를 오케스트레이션하기 위해 다양한 LLM을 지원합니다.

  • • Visa는 보안 하네스를 VVAH로 브랜드화하고 자동 수정 생성 및 검증 기능을 포함하도록 기능을 확장했습니다.
  • • 이 프로젝트는 현재 Nvidia의 Open Secure AI Alliance 및 Project Lightwell에 기여되고 있습니다.
  • • VVAH는 취약점 수정을 위한 모델에 구애받지 않는 다단계 파이프라인을 계속 지원합니다.
  • • 패치 검토 및 병합을 위한 VVAH 워크플로우의 필수 구성 요소로 인간의 감독이 유지됩니다.

이번 개발은 Visa의 내부 보안 도구가 더 넓은 산업 협력으로 전환되는 것을 의미하며, 이전에 출시된 스캔 하네스에 자동 수정 기능을 추가했습니다.

SOURCES

14. Microsoft, 에이전트 최적화를 위한 AutoSaddler 오픈소스 공개

Microsoft는 AI 에이전트 성능을 최적화하기 위해 설계된 도구인 AutoSaddler를 오픈소스로 공개했습니다. 실행 추적을 분석함으로써 AutoSaddler는 에이전트 프롬프트, 도구 구성 및 미들웨어를 자동으로 개선합니다. 이러한 자동 최적화 루프는 개발자가 수동 시행착오 튜닝 없이 에이전트의 신뢰성과 효율성을 향상하도록 돕습니다.

  • • AutoSaddler는 Microsoft가 개발한 오픈소스 시스템으로 GitHub에서 사용할 수 있습니다.
  • • 이 시스템은 에이전트 실행 추적을 분석하여 성능 병목 현상을 식별합니다.
  • • 에이전트 성공률을 높이기 위해 프롬프트, 도구 및 미들웨어를 자동으로 업데이트합니다.

개발자들은 AutoSaddler가 실제 실행 데이터를 기반으로 프롬프트와 도구 정의를 최적화하도록 함으로써 에이전트 프롬프트와 도구 정의를 튜닝하는 지루한 과정을 자동화할 수 있습니다.

SOURCES

15. Open Executive, Apache 2.0 다중 에이전트 가상 팀 출시

Sentelabs.ai는 가상 경영진 팀 역할을 하도록 설계된 오픈소스 다중 에이전트 프레임워크인 Open Executive를 출시했습니다. Apache 2.0 라이선스로 출시된 이 시스템은 오케스트레이션을 위해 Claude-Sonnet-4-6을 사용하고 RAG 기반 지식 검색을 위해 ChromaDB를 사용하여 8명의 전문 에이전트를 조정합니다. Claude-Haiku-4-5로 처리되는 SQLite 데이터베이스에 에피소드 기억을 유지하고 Fly.io 배포를 지원하며, 개발자가 Anthropic API를 로컬 OpenAI 호환 모델로 교체할 수 있도록 합니다.

  • • Open Executive는 sentelabs.ai가 Apache 2.0 라이선스로 출시한 오픈소스 시스템입니다.
  • • Claude-Sonnet-4-6과 ChromaDB를 사용하여 8명의 전문 에이전트(전략, 재무, 인사 등)를 오케스트레이션합니다.
  • • 이 시스템은 Fly.io 배포를 지원하며 로컬 OpenAI 호환 모델에서 실행할 수 있습니다.

개발자들은 내장된 메모리와 RAG를 갖춘 Claude 또는 로컬 OpenAI 호환 모델을 활용하여 Fly.io에 사전 구축된 고도로 구조화된 다중 에이전트 시스템을 배포할 수 있습니다.

SOURCES

16. 프레임워크 없는 AI 엔지니어 노트북, Colab에 출시

AI 엔지니어링 및 FDE(Forward Deployed Engineer) 기술을 가르치기 위해 일련의 무료 프레임워크 없는 Colab 노트북이 출시되었습니다. LangChain이나 LlamaIndex와 같은 추상화를 피함으로써, 이 커리큘럼은 원시 모델 API에서 직접 RAG, 에이전트 및 평가 파이프라인을 구축하는 데 중점을 둡니다. 독립형 노트북은 무료 Groq API에서 실행되며 프로덕션 디버깅, 견고성 벤치마킹 및 포트폴리오 준비가 완료된 캡스톤 프로젝트에 대한 특정 사례 연구를 포함합니다.

  • • 이 커리큘럼은 상위 수준 프레임워크가 아닌 원시 모델 API를 사용하여 AI 시스템을 구축하는 데 중점을 둡니다.
  • • 노트북은 무료 Groq API에서 실행되며 신용 카드나 유료 구독이 필요하지 않습니다.
  • • 주제에는 RAG, 에이전트, 파인튜닝, 보안, LLMOps 및 프로덕션 디버깅이 포함됩니다.

개발자들은 LangChain이나 LlamaIndex와 같은 프레임워크의 추상화 오버헤드 없이 RAG, 에이전트 및 평가의 기본 패턴을 마스터할 수 있습니다.

SOURCES

17. Harness Engineering 프레임워크, AI 코드 관리 공식화

에이전트 동작을 구현에 매핑한 Harness Handbook의 릴리스에 이어, 새로운 Harness Engineering 프레임워크는 AI 지원 코드 생성을 관리하기 위한 체계적인 접근 방식을 도입합니다. 이는 프로젝트 제약 조건을 위한 HARNESS.md 파일, 아키텍처 검증 루프 및 코드베이스 엔트로피를 완화하기 위한 예약된 가비지 컬렉션을 구현하여 이전 지침을 확장합니다.

  • • Harness Handbook을 확장하여 AI 지원 코드 생성을 위한 전체 프레임워크를 제공합니다.
  • • HARNESS.md 파일을 사용하여 프로젝트 제약 조건과 아키텍처 결정을 정의합니다.
  • • 린터나 에이전트 기반 검토를 사용하여 검증 슬롯을 통해 제약 조건을 강화합니다.
  • • 코드베이스 엔트로피와 오래된 종속성을 관리하기 위한 가비지 컬렉션 프로세스를 포함합니다.

개발자들은 이제 에이전트 동작을 매핑하는 것을 넘어 구조화된 제약 조건과 자동화된 검증을 통해 프로젝트 규칙과 코드베이스 상태를 적극적으로 강화할 수 있습니다.

SOURCES

18. EDB, Postgres 데이터 계층에서 AI 에이전트 거버넌스 옹호

EnterpriseDB(EDB)는 에이전트가 자율성을 얻음에 따라 보안과 감사 가능성이 운영 데이터 계층에서 강화되어야 한다고 주장하며 AI 에이전트 거버넌스의 변화를 옹호하고 있습니다. EDB Postgres AI 플랫폼을 통해 이 회사는 역할 기반 액세스, 동적 열 마스킹, 에이전트 ID를 일등 데이터베이스 주체로 취급하는 것을 포함한 9가지 제어 프레임워크를 제안하여 무단 데이터 액세스를 방지하고 실시간 정책 강화를 보장합니다.

  • • EDB는 Enforce, See/Prove, Unify/Harden의 세 가지 범주에 걸쳐 9가지 거버넌스 제어를 제안합니다.
  • • 주요 제어에는 역할 및 속성 기반 액세스 제어, 동적 열 마스킹, 에이전트 ID를 일등 주체로 취급하는 것이 포함됩니다.
  • • 이 프레임워크는 EDB의 백서 'Governing Agentic AI at Enterprise Speed'에 자세히 설명되어 있습니다.

개발자들은 애플리케이션 수준의 논리에만 의존하는 대신 데이터베이스 계층에서 액세스 제어, 열 마스킹 및 ID 확인을 강화하여 자율 에이전트를 보호할 수 있습니다.

SOURCES

19. Claude 데스크톱 앱, 내부 브라우저 기능 출시

Anthropic은 이번 주 Claude 데스크톱 애플리케이션 내에 내부 브라우저 기능을 출시하고 있습니다. Pro, Max 및 Team 구독자가 사용할 수 있는 이 통합(Cowork 기반)을 통해 Claude는 데스크톱 앱 내에서 직접 웹 페이지를 탐색하고 상호 작용할 수 있어 실시간 웹 조사가 필요한 워크플로우를 간소화합니다.

  • • Claude의 내부 브라우저는 이번 주 Claude 데스크톱 애플리케이션 내에서 출시됩니다.
  • • 이 기능은 Pro, Max 및 Team 플랜 구독자가 사용할 수 있습니다.
  • • 브라우저 통합은 Cowork에 의해 구동됩니다.

Claude 데스크톱 앱을 사용하는 개발자는 이제 모델이 애플리케이션 작업 공간 내에서 직접 웹 콘텐츠를 탐색하고 상호 작용하도록 할 수 있습니다.

SOURCES

20. gemma4.c, 700줄의 C 코드로 Gemma 4 추론 구현

gemma4.c 프로젝트는 단 700줄의 순수 C 코드로 Google의 Gemma 4 E2B 언어 모델을 베어메탈 구현했습니다. 교육용 도구로 설계된 이 프로젝트는 외부 추론 프레임워크에 의존하지 않고 표준 CPU에서 완전히 실행됩니다. 자체 토크나이저, 트랜스포머, KV 캐시 및 샘플링 논리를 특징으로 하며, int8 양자화, OpenMP 및 AVX-512 VNNI를 활용하여 소비자용 Ryzen 7 프로세서에서 생성 중 초당 25.9 토큰을 달성합니다.

  • • gemma4.c는 일반 CPU에서 Google의 Gemma 4 E2B 모델을 실행하는 단일 700줄 C 파일입니다.
  • • 런타임에는 자체 토크나이저, 트랜스포머, KV 캐시, 샘플링 및 CPU 커널이 포함됩니다.
  • • int8 가중치, OpenMP, AVX2 및 AVX-512 VNNI를 활용하여 Ryzen 7 7700에서 생성 중 25.9 t/s를 달성합니다.

개발자들은 표준 CPU에 최적화된 최신 LLM 추론, 토크나이징 및 KV 캐싱의 베어메탈, 종속성 없는 구현을 연구할 수 있습니다.

SOURCES

21. Engram 기술, N-Gram 룩업 테이블로 암기 오프로드

Engram 기술은 암기와 추론을 분리하여 모델 효율성을 최적화하는 강력한 방법으로 부상하고 있습니다. 단일 토큰 ID를 사용하는 대신 Engram은 마지막 2~3개 토큰의 N-gram으로 벡터를 인덱싱하여 모델이 엔티티 이름과 같은 정적 정보에 대해 상수 시간 데이터베이스 룩업을 수행할 수 있도록 합니다. Qwen 3.8 Flash Next에서 51B 파라미터의 임베딩을 관리하면서 6B 파라미터만 활성화하는 데 사용되는 이 접근 방식은 FLOP를 추가하지 않고도 신경망 레이어가 추론 작업에만 집중할 수 있도록 합니다.

  • • Engram은 단일 토큰 ID 대신 마지막 2~3개 토큰의 N-gram으로 벡터를 인덱싱하는 임베딩 테이블로 기능합니다.
  • • Qwen 3.8 Flash Next는 51B 파라미터의 N-gram 임베딩을 활용하면서 토큰당 6B 파라미터만 활성화합니다.
  • • Engram 룩업은 상수 시간에 실행되며 추가적인 FLOP나 문맥 의존적 처리가 필요하지 않습니다.

이 기술을 사용하면 더 작고 빠른 모델이 활성 파라미터 수나 FLOP를 늘리지 않고도 방대한 정적 데이터베이스(예: 엔티티 이름)를 처리할 수 있습니다.

SOURCES

22. Grok Bot, 이제 Cursor 및 SuperGrok 구독 플랜에 포함

8월 11일 Grok Bot 출시를 바탕으로, Cursor는 Grok Bot을 Cursor 및 SuperGrok 구독 플랜에 직접 포함하도록 서비스 모델을 업데이트했습니다. 이러한 변경으로 개발자는 기존 플랜 사용 제한을 소모하지 않고도 지속적인 AI 에이전트 환경에 대한 확장된 액세스를 얻을 수 있습니다.

  • • Grok Bot은 이제 Cursor 및 SuperGrok 구독 플랜과 번들로 제공됩니다.
  • • Grok Bot에 대한 액세스는 더 이상 기존 플랜 사용 제한에 포함되지 않습니다.
  • • 이번 업데이트는 8월 11일 Grok Bot의 초기 베타 출시를 따릅니다.

이번 업데이트는 Grok Bot을 별도의 유료 제품에서 포함된 기능으로 전환하여 Cursor 사용자가 추가 비용이나 할당량 걱정 없이 지속적인 AI 에이전트를 워크플로우에 통합할 수 있도록 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.