Inference Brew

OpenAI, 무료 사용자에게 무제한 텍스트 채팅 및 GPT-5.6 Luna 제공

00:00 / --:--

← 메인으로

OpenAI, 무료 사용자에게 무제한 텍스트 채팅 및 GPT-5.6 Luna 제공

1. OpenAI, 무료 사용자에게 무제한 텍스트 채팅 및 GPT-5.6 Luna 제공

OpenAI는 당초 다음 주에 제공될 예정이었던 기능들을 앞당겨, GPT-5.6 Luna를 무료 및 Go 사용자를 위한 기본 모델로 공식 적용했습니다. 또한 어제 발표된 약속대로 텍스트 전용 채팅에 대한 모든 사용 제한을 해제했습니다. 파일, 이미지, 음성에 대한 멀티모달 제한은 그대로 유지되며, 더 높은 수준의 추론을 위한 새로운 'Think' 버튼을 선택적으로 사용할 수 있습니다.

  • • GPT-5.6 Luna가 무료 및 Go 사용자를 위한 기본 모델로 설정되었습니다.
  • • 텍스트 기반 채팅 사용 제한이 즉시 해제되었습니다.
  • • 당초 예정된 '다음 주' 일정보다 빠르게 롤아웃이 진행되었습니다.
  • • 파일, 이미지, 음성에 대한 제한은 변경되지 않았습니다.
  • • 더 높은 수준의 추론을 위한 새로운 'Think' 버튼을 사용할 수 있습니다.

롤아웃이 당초 계획보다 빠르게 완료됨에 따라, 사용자 및 개발자는 텍스트 상호작용을 위해 GPT-5.6 Luna에 즉각적이고 제한 없이 액세스할 수 있게 되었습니다.

SOURCES

2. DeepSeek, V4-Flash 모델에 추론 변형 추가

DeepSeek-V4-Flash API의 최근 공개 베타 출시에 이어, DeepSeek는 V4-Flash 0731 모델을 도입했습니다. 이번 업데이트는 아키텍처에 3가지의 독특한 추론 변형을 추가하여, ARC-AGI-1 Semi-Private 벤치마크에서 89.0%, ARC-AGI-2 Semi-Private 벤치마크에서 61.4%의 성능을 달성했습니다. 이 변형 모델들은 작업당 각각 $0.02 및 $0.04의 가격으로 제공되어, 복잡한 추론 워크로드를 위한 전문적이고 비용 효율적인 옵션을 제공합니다.

  • • DeepSeek가 3가지 추론 변형을 포함한 V4-Flash 0731 모델을 출시했습니다.
  • • 해당 모델은 작업당 $0.02의 비용으로 ARC-AGI-1 Semi-Private 벤치마크에서 89.0%를 달성했습니다.
  • • 해당 모델은 작업당 $0.04의 비용으로 ARC-AGI-2 Semi-Private 벤치마크에서 61.4%를 달성했습니다.

이번 릴리스는 개발자들에게 비용 효율적인 V4-Flash 생태계 내에서 전문적인 추론 기능을 제공하여, 낮은 가격으로 높은 정확도의 추상적 추론을 가능하게 합니다.

SOURCES

3. Wan-Animate-2 캐릭터 애니메이션 프레임워크 출시

Wan-Animate-2 개발자들은 엔드투엔드 캐릭터 애니메이션 프레임워크를 위한 추론 스크립트, 기본 모델 가중치, 증류 모델 가중치를 공개했습니다. Hugging Face의 Wan-AI 조직을 통해 호스팅되는 이 프레임워크는 재설계된 Diffusion Transformer를 사용하여 구동 영상에서 직접 동작을 생성하며, 중간 동작 추출기를 거치지 않아 정체성 보존과 동작 충실도를 향상시킵니다. 이번 릴리스에는 실시간 스트리밍 지연 시간을 위해 최적화된 Wan-Animate-2-Lite 변형이 포함되어 있으며, 텍스트 기반 시점 제어를 지원하여 출력 카메라 관점을 소스 영상과 분리할 수 있습니다.

  • • Wan-Animate-2는 재설계된 Diffusion Transformer를 사용하는 엔드투엔드 캐릭터 애니메이션 프레임워크입니다.
  • • 중간 동작 추출기를 제거하여 정체성을 보존하고 구동 영상에서 직접 동작을 생성합니다.
  • • 텍스트 기반 시점 제어 기능을 통해 출력 카메라 관점을 구동 영상과 분리할 수 있습니다.
  • • Wan-Animate-2-Lite는 실시간 스트리밍 지연 시간을 위해 설계된 효율적인 변형입니다.
  • • 2026년 8월 7일 Hugging Face를 통해 추론 스크립트, 기본 모델 가중치, 증류 모델 가중치가 공개되었습니다.

개발자들은 구동 영상에서 직접 동작을 생성하는 오픈 가중치 모델을 사용하여 고충실도의 실시간 캐릭터 애니메이션 기능을 구축할 수 있습니다.

SOURCES

4. Cloudflare, 에이전트 우선 헤드리스 브라우저 'Kitesurf' 출시

Cloudflare는 인간 사용자가 아닌 AI 에이전트를 위해 처음부터 구축된 헤드리스 브라우저 Kitesurf를 도입했습니다. Cloudflare의 서버리스 Workers 플랫폼에서 실행되도록 12주에 걸쳐 개발된 Kitesurf는 시각적 요소보다 컨텍스트 윈도우 관리, 토큰 비용, 리소스 효율성을 우선시합니다. Rust와 WebAssembly로 구축되었으며, Blitz의 렌더링 엔진, Firefox의 Stylo CSS 파서, Boa JS 엔진을 활용합니다. 현재 비디오 재생, WebGL, 지속적 상태 지원은 부족하지만, 215,000개 이상의 웹 플랫폼 테스트를 통과했으며 Chrome DevTools Protocol을 통해 Puppeteer 및 Playwright와 완벽하게 호환됩니다.

  • • Cloudflare는 AI 에이전트에 최적화된 클라우드 호스팅 브라우저 Kitesurf를 출시했으며, 현재 Browser Run을 통해 베타 버전으로 무료 제공됩니다.
  • • 이 브라우저는 Cloudflare Workers에서 완전히 실행되며, Blitz의 모듈식 렌더링 엔진, Firefox의 Stylo CSS 파서, Rust 기반 Boa JS 엔진을 활용합니다.
  • • Kitesurf는 HTML 추출 및 스크린샷과 같은 에이전트 작업에서 Chromium보다 3~7배 더 나은 메모리 및 CPU 효율성을 제공합니다.
  • • Chrome DevTools Protocol(CDP)을 지원하여 Puppeteer 및 Playwright와 같은 기존 도구와 호환됩니다.
  • • 아키텍처는 상태 비저장 및 격리 방식으로, 신뢰할 수 없는 입력을 처리하기 위해 세션마다 새로 시작됩니다.

개발자들은 서버리스 인프라에서 직접 Chromium보다 3~7배 더 나은 CPU 및 메모리 효율성으로 AI 에이전트를 위한 헤드리스 브라우저 작업을 실행할 수 있습니다.

5. NVIDIA, NOOA 객체 지향 에이전트 프레임워크 출시

NVIDIA Labs는 에이전트 구성 요소를 객체 지향 프로그래밍 개념에 직접 매핑하여 에이전트 개발을 단순화하는 Apache 2.0 라이선스 Python 프레임워크인 NOOA(NVIDIA Object-Oriented Agents)를 출시했습니다. NOOA에서 전체 에이전트는 단일 Python 클래스로 정의되며, 메서드는 작업을 나타내고, 필드는 상태를 나타내며, 독스트링은 프롬프트 역할을 하고, 타입 어노테이션은 런타임 강제 계약 역할을 합니다. 이 프레임워크는 LLM 기반 루프와 결정론적 메서드를 모두 지원하며, 모델 플러그인을 위해 LiteLLM을 활용하고, 제한된 미리보기가 포함된 '참조에 의한 전달(pass by reference)'을 통해 대규모 데이터를 처리합니다. 프레임워크가 LLM 생성 코드를 실행하기 때문에, NVIDIA는 컨테이너나 가상 머신과 같은 격리된 환경에서 NOOA 에이전트를 실행할 것을 강력히 권장합니다.

  • • NVIDIA Labs는 Apache 2.0 라이선스 하에 모델 애그노스틱 Python 프레임워크인 NOOA(NVIDIA Object-Oriented Agents)를 출시했습니다.
  • • NOOA는 프롬프트 템플릿, 도구 스키마, 콜백 코드, 워크플로우 그래프를 단일 Python 클래스로 통합합니다.
  • • 메서드는 작업을 나타내고, 필드는 상태를 나타내며, 독스트링은 프롬프트 역할을 하고, 타입 어노테이션은 런타임 강제 계약 역할을 합니다.
  • • 이 프레임워크는 LLM 기반 루프(AgenticMethod)와 결정론적 Python 메서드를 모두 지원합니다.
  • • Python 3.12~3.13이 필요하며 LiteLLM을 통해 호스팅된 API, Ollama, vLLM과 통합됩니다.
  • • NVIDIA는 LLM 생성 코드 실행으로 인해 OS 수준 격리(컨테이너 또는 VM) 내에서 NOOA 에이전트를 실행할 것을 권장합니다.

개발자들은 익숙한 객체 지향 프로그래밍 패턴을 사용하여 AI 에이전트를 구축하고, 표준 Python 타입 어노테이션을 통해 런타임 계약을 강제할 수 있습니다.

SOURCES

6. Microsoft, 다국어 단위 테스트 생성 에이전트 오픈 소스 공개

Microsoft는 MIT 라이선스로 출시된 로컬 다국어 단위 테스트 생성 에이전트인 code-testing-generator를 오픈 소스로 공개했습니다. 호스팅된 서비스 없이 기존 로컬 코딩 환경 내에서 완전히 작동하는 이 에이전트는 RPI(Research-Plan-Implement) 파이프라인을 사용하여 코드를 작성하기 전에 저장소 규칙, 파일 위치 및 테스트 프레임워크를 분석합니다. 변이 테스트를 수행하고, 누락된 어설션을 확인하며, 저장소의 테스트 명령이 새 테스트를 성공적으로 검색하도록 보장하는 내장 검증 게이트를 갖추고 있습니다. 내부 벤치마크에서 이 에이전트는 92.1%의 작업 완료율을 달성하여 기존 GitHub Copilot의 78.9%를 크게 앞질렀습니다.

  • • Microsoft는 MIT 라이선스 하에 다국어 단위 테스트 에이전트인 code-testing-generator를 오픈 소스로 공개했습니다.
  • • 이 에이전트는 기존 코딩 환경 내에서 로컬로 실행되며 호스팅된 서비스가 필요하지 않습니다.
  • • RPI(Research-Plan-Implement) 파이프라인을 활용하여 저장소 규칙과 테스트 프레임워크를 분석합니다.
  • • Microsoft의 내부 152개 작업 벤치마크에서 이 에이전트는 92.1%의 작업을 완료했으며, 기존 GitHub Copilot은 78.9%를 기록했습니다.
  • • 변이 테스트를 수행하고 누락된 어설션을 확인하는 검증 게이트가 포함되어 있습니다.

개발자들은 기존 Copilot보다 뛰어난 성능을 발휘하고 생성된 테스트를 자동으로 검증하는 고성능 로컬 단위 테스트 에이전트를 실행할 수 있습니다.

SOURCES

7. AgentRadio, 엔터프라이즈 코딩 작업에서 Claude Code 능가

Coral AI Labs와 여러 대학의 연구원들은 장기 코드베이스 작업에서 AI 에이전트 팀을 조정하기 위해 설계된 비동기 메시지 전달 계층인 AgentRadio를 오픈 소스로 공개했습니다. Apache 2.0 라이선스로 출시된 AgentRadio는 create_thread, send_message, wait_for_mention이라는 세 가지 통신 기본 요소를 도입하여 에이전트가 기본 실행 루프를 방해하지 않고 컨텍스트를 공유하고 지식을 업데이트할 수 있도록 합니다. SWE-Atlas QnA 데이터셋 벤치마크에서 AgentRadio 기반 팀은 62.1%의 작업을 해결한 반면, Opus 4.6을 사용하는 단일 Claude Code 에이전트는 32.3%를 해결했습니다. 조정 계층으로 인해 작업당 평균 API 비용이 $2.96에서 $19.45로 증가했지만, 컴퓨팅이 일치하는 독립적인 에이전트 설정보다 훨씬 뛰어난 성능을 보였습니다.

  • • 연구원들은 Apache 2.0 라이선스 하에 AI 에이전트 조정을 위한 비동기 메시지 전달 계층인 AgentRadio를 오픈 소스로 공개했습니다.
  • • AgentRadio는 create_thread, send_message, wait_for_mention이라는 세 가지 기본 요소를 통해 수동적 인식을 가능하게 합니다.
  • • SWE-Atlas QnA 벤치마크에서 AgentRadio 기반 팀은 62.1%의 작업을 해결했으며, 단일 Claude Code 에이전트는 32.3%를 기록했습니다.
  • • 이 아키텍처는 GitHub에서 사용할 수 있으며 Claude Code나 Codex CLI와 같은 기존 에이전트 하네스와 호환됩니다.
  • • 작업당 평균 API 비용이 $2.96에서 $19.45로 증가했지만, 컴퓨팅이 일치하는 독립적인 설정보다 뛰어난 성능을 보였습니다.

개발자들은 이 오픈 소스 조정 계층을 사용하여 비동기적으로 통신하는 멀티 에이전트 팀을 구축함으로써 복잡한 코드베이스에서의 작업 해결률을 크게 향상시킬 수 있습니다.

SOURCES

8. Tencent Cloud, TencentDB Agent Memory를 v2.0으로 업그레이드

2026년 5월 TencentDB Agent Memory의 초기 릴리스를 기반으로, Tencent Cloud는 버전 2.0을 출시했습니다. 이번 업데이트는 개별 에이전트 메모리에서 팀 수준 허브로 초점을 전환하여 여러 에이전트가 컨텍스트와 기술을 공유할 수 있도록 합니다. 새 버전은 Chat Memory, Skill, LLM-Wiki, Code-Graph라는 4가지 자산 유형을 도입하고 Claude Code 및 OpenClaw 통합 지원을 추가했습니다.

  • • TencentDB Agent Memory v2.0은 기존 프레임워크를 팀 수준 메모리 허브로 확장합니다.
  • • Chat Memory, Skill, LLM-Wiki, Code-Graph라는 4가지 재사용 가능한 자산 유형을 도입합니다.
  • • Claude Code, OpenClaw, Hermes 통합 지원을 추가합니다.
  • • 초기 릴리스의 자체 호스팅, MIT 라이선스, Docker 배포 가능 특성을 유지합니다.
  • • 계층적 검색 접근 방식(BM25, 벡터 검색, RRF)을 계속 사용합니다.

이번 업데이트를 통해 팀은 여러 AI 에이전트 간에 지속적이고 공유된 메모리를 유지할 수 있게 되었으며, 초기 릴리스의 단일 에이전트 범위를 넘어섰습니다.

SOURCES

9. Databricks, AI 코딩 비용 절감을 위한 도구 오픈 소스 공개

Databricks는 기하급수적으로 증가하는 AI 코딩 비용을 관리하기 위한 전략을 공유하며, 하네스 및 캐싱 최적화를 통해 전체 비용을 70%, 생성된 토큰을 50% 절감했다고 밝혔습니다. 다른 조직이 AI 인프라 비용을 관리할 수 있도록 Databricks는 Unity AI Gateway 및 Omnigent 도구를 오픈 소스로 공개했습니다. Omnigent는 모델 독립성을 유지하는 메타 하네스 역할을 하여 개발자가 기본 모델을 쉽게 전환하고, 단순히 최고의 지능이 아닌 '가격 대비 지능' 비율이 가장 좋은 모델을 우선시하는 '효율성 경계(efficiency frontier)'를 목표로 할 수 있게 합니다.

  • • Databricks는 하네스 및 캐싱 설정을 조정하여 생성된 토큰과 비용을 거의 50% 절감했습니다.
  • • 회사는 Unity AI Gateway 및 Omnigent 도구를 오픈 소스 또는 무료 소프트웨어로 출시했습니다.
  • • Omnigent는 모델 독립성을 유지하고 개발자 전환 비용을 줄이기 위해 설계된 메타 하네스입니다.
  • • Databricks는 가격 대비 지능 비율이 가장 좋은 모델을 우선시하는 '효율성 경계' 접근 방식을 옹호합니다.
  • • 회사는 고정된 토큰 예산을 가시성 도구 및 점진적 마찰로 대체할 것을 권장합니다.

개발자들은 오픈 소스 도구와 최적화 전략을 사용하여 코드 품질을 희생하지 않으면서 API 토큰 사용량과 비용을 크게 절감할 수 있습니다.

SOURCES

10. Agent Plugins 1.0.0 오픈 표준 출시

Agent Plugins 1.0.0의 출시는 개발자가 재사용 가능한 AI 에이전트 기술 및 MCP(Model Context Protocol) 서버를 패키징하고 배포하는 방식을 단순화하기 위한 새로운 오픈 표준을 도입합니다. 통합 사양을 확립함으로써 이 표준은 개발자가 에이전트 기능을 휴대용 플러그인으로 번들링하여 다양한 에이전트 런타임 및 프레임워크 전반에서 통합을 간소화할 수 있도록 합니다.

  • • Agent Plugins 1.0.0은 재사용 가능한 AI 에이전트 기술 및 MCP 서버 패키징을 단순화하기 위해 설계된 오픈 표준입니다.
  • • 이 표준은 에이전트 기능을 플러그인으로 쉽게 배포할 수 있도록 하는 것을 목표로 합니다.

개발자들은 통합 표준을 사용하여 다양한 에이전트 프레임워크 전반에서 에이전트 기능과 MCP 서버를 패키징, 배포 및 재사용할 수 있습니다.

SOURCES

11. NVIDIA NeMo Retriever 및 LanceDB를 사용한 멀티모달 RAG 파이프라인 구축

NVIDIA는 PDF 문서에서 텍스트, 표, 차트, 인포그래픽을 처리할 수 있는 멀티모달 RAG(검색 증강 생성) 파이프라인을 구축하기 위한 포괄적인 패턴을 개략적으로 설명했습니다. Python 3.12로 구성된 이 파이프라인은 GPU 없이 오프라인 텍스트 추출을 위해 PDFium을 사용한 다음, 레이아웃 감지, OCR, 표 추출, 임베딩 생성 및 재순위를 위해 호스팅된 NVIDIA NIM 엔드포인트를 활용합니다. 처리된 데이터는 LanceDB 벡터 데이터베이스에 저장되어 메타데이터 필터링 검색, 비전-언어 재순위, Nemotron 언어 모델을 사용한 인라인 인용이 포함된 근거 있는 응답 생성을 가능하게 합니다.

  • • 이 파이프라인은 레이아웃 감지, OCR, 표/차트 추출, 임베딩 생성 및 재순위를 위해 호스팅된 NVIDIA NIM 엔드포인트를 사용합니다.
  • • 처리된 콘텐츠는 LanceDB 벡터 데이터베이스에 저장됩니다.
  • • 오프라인 PDF 텍스트 추출은 GPU나 외부 API 키 없이 PDFium을 사용하여 수행됩니다.
  • • 이 시스템은 메타데이터 필터링 검색, 비전-언어 재순위, 인라인 인용이 포함된 근거 있는 응답 생성을 구현합니다.
  • • 파이프라인은 Python 3.12로 구성되며 근거 있는 답변을 위해 Nemotron 언어 모델을 사용합니다.

개발자들은 구조화되고 검증된 파이프라인 패턴을 사용하여 고급 멀티모달 검색(텍스트, 표, 차트, 인포그래픽 처리)을 구현할 수 있습니다.

SOURCES

12. NVIDIA, NeMo Gym 대화형 도구 사용 자산 출시

NVIDIA는 Hugging Face에 NeMo Gym 대화형 도구 사용 자산을 출시했습니다. 이 릴리스는 개발자들에게 엄선된 골든 정책/도구 참조 쌍 및 프롬프트 기록 컬렉션을 제공합니다. 이러한 자산은 개발자가 대화형 도구 사용 파이프라인 내에서 LLM을 훈련, 미세 조정 및 평가하여 에이전트 도구 호출 워크플로우의 신뢰성을 향상시키도록 돕기 위해 설계되었습니다.

  • • NVIDIA는 Hugging Face 플랫폼에 NeMo Gym 대화형 도구 사용 자산을 출시했습니다.
  • • 이 릴리스에는 골든 정책/도구 참조 쌍 및 프롬프트 기록 컬렉션이 포함되어 있습니다.
  • • 이 자산은 대화형 도구 사용 파이프라인을 위해 특별히 설계되었습니다.

개발자들은 고품질 참조 데이터셋을 사용하여 대화형 도구 호출 작업에서 자신의 모델을 훈련, 미세 조정 또는 평가할 수 있습니다.

SOURCES

13. Parakeet.wgsl, WebGPU를 통한 빠르고 종속성 없는 브라우저 ASR 구현

parakeet.wgsl이라는 새로운 오픈 소스 프로젝트는 고성능의 종속성 없는 자동 음성 인식(ASR)을 브라우저로 직접 가져옵니다. 이 구현은 원시 WebGPU 컴퓨팅 셰이더와 SIMD WebAssembly 오디오 프론트엔드를 사용하여 NVIDIA의 Parakeet TDT 0.6B V2 영어 전사 모델을 패키징합니다. 벤치마크에 따르면 이 시스템은 Google Chrome을 실행하는 Apple M5 프로세서에서 1시간 분량의 오디오를 단 20초 만에 전사할 수 있습니다. WebGPU에 의존하기 때문에 모델은 완전히 오프라인으로 실행될 수 있으며 WebGPU 지원 브라우저를 호스팅하는 모든 장치와 호환되며, Dawn이나 wgpu를 통해 독립형 데스크톱 실행 가능성도 있습니다.

  • • 이 프로젝트는 브라우저 기반 추론을 위해 NVIDIA의 Parakeet TDT 0.6B V2 영어 전사 모델을 구현합니다.
  • • 원시 WebGPU 컴퓨팅 셰이더와 SIMD WebAssembly 오디오 프론트엔드를 활용하여 종속성이 없습니다.
  • • Google Chrome을 실행하는 Apple M5 프로세서에서 1시간 분량의 오디오를 20초 만에 전사할 수 있습니다.
  • • 이 소프트웨어는 GPU와 WebGPU 지원 브라우저가 장착된 모든 장치와 호환됩니다.
  • • Dawn이나 wgpu와 같은 프레임워크를 사용하여 브라우저 외부에서 오프라인 실행할 수 있는 잠재력을 지원합니다.

개발자들은 외부 API나 무거운 백엔드 서버에 의존하지 않고 브라우저에서 직접 빠르고 개인적이며 오프라인인 음성-텍스트 변환을 구현할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.