1. NVIDIA Groq 3 LPX 추론 가속기 본격 양산 돌입
Gemma 4 31B 모델에서 초당 3,400 토큰을 기록한 최근 벤치마크 결과를 바탕으로, NVIDIA가 Groq 3 LPX 추론 가속기 랙의 공식 양산에 돌입했습니다. Vera Rubin 플랫폼을 확장하는 이 시스템은 고속 에이전트 AI 워크로드를 위해 설계되었으며, 올해 말 운영이 시작될 예정입니다.
- • NVIDIA의 Groq 3 LPX 추론 가속기 칩이 본격적인 양산에 돌입했습니다.
- • 해당 시스템은 올해 말 운영이 시작될 예정입니다.
- • 양산형 유닛은 에이전트 AI 워크로드를 위해 최근 벤치마크에서 확인된 초당 3,400 토큰의 성능을 유지하도록 설계되었습니다.
본격적인 양산 체제 전환은 시연 단계의 성능을 넘어, 초저지연 추론을 필요로 하는 개발자들이 상업적으로 제품을 이용할 수 있게 되었음을 의미합니다.
2. IBM, 네이티브 추론 기능을 갖춘 Granite 4.2 모델 제품군 출시
디코더 전용 덴스 트랜스포머 아키텍처를 기반으로 구축된 Granite-4.2-30B 모델은 Grouped Query Attention, Rotary Position Embedding 및 SwiGLU 활성화 함수를 사용합니다. 유연한 사고 모드를 통해 개발자는 쿼리별로 모델의 추론 깊이를 맞춤 설정하여 비용과 지연 시간을 최적화할 수 있습니다.
- • Granite 4.2 제품군은 30B 플래그십, 8B 중형, 3B 소형 모델로 구성되며 모두 Apache 2.0 라이선스로 출시되었습니다.
- • 모든 모델은 수학, 코딩 및 다단계 문제 해결 성능을 향상하기 위해 네이티브 사고의 연쇄 추론 기능을 갖추고 있습니다.
- • 모델은 깊이와 지연 시간의 균형을 맞추기 위해 세 가지 유연한 사고 모드(전체 사고, 사고 없음, 저노력)를 지원합니다.
- • 전 제품군이 긴 문서와 에이전트 워크플로우를 위해 512K 컨텍스트 윈도우를 지원합니다.
- • 모델은 함수 호출 정확도를 높이기 위해 추론 증강 도구 호출 기능을 활용합니다.
개발자는 지연 시간과 추론 깊이의 균형을 맞출 수 있는 유연한 사고 모드를 갖춘, 상업적으로 활용 가능한 고성능 추론 모델을 직접 호스팅하거나 통합할 수 있습니다.
3. Microsoft, 리더보드 상위권을 차지한 MAI-Image-2.6-Preview 출시
이 모델은 텍스트-이미지 생성과 이미지 편집 기능을 모두 지원합니다. 조명 및 UI/UX 디자인과 같은 카테고리에서 MAI-Image-2.6-Preview와 GPT Image 2는 몇 Elo 포인트 차이 내에서 경쟁하며 개발자들에게 매우 경쟁력 있는 대안을 제공합니다.
- • Microsoft는 텍스트 렌더링, 3D 이미지, 인물 사진 품질 및 사실적인 출력물이 개선된 MAI-Image-2.6-Preview를 발표했습니다.
- • 이 모델은 Artificial Analysis 이미지 편집 리더보드에서 MAI-Image-2.5-Pro, Reve 2.1, GPT Image 2를 제치고 1위로 데뷔했습니다.
- • 텍스트-이미지 카테고리에서는 OpenAI의 GPT Image 2에 이어 2위를 기록했습니다.
- • 현재 MAI Playground와 Microsoft Foundry의 Private Preview에서 이용할 수 있습니다.
- • MAI-Image-2.6-Preview는 재료, 지식, 프론티어, 소매 및 전자상거래, 마케팅 및 광고를 포함한 19개 카테고리 리더보드 중 5개에서 1위를 차지했습니다.
이미지 편집 또는 생성 기능을 구축하는 개발자들은 GPT Image 2와 비교 평가할 수 있는 새로운 고성능 모델 옵션을 확보하게 되었습니다.
4. Breeze TTS 2, 오픈 웨이트 TTS 리더보드에서 Fish Audio S2 Pro 추월
2026년 5월 벤치마크 보고서 이후, Artificial Analysis Speech Arena는 Breeze TTS 2를 포함하도록 순위를 업데이트했습니다. 이 새로운 모델은 Elo 1,215점을 기록하며 이전 1위인 Fish Audio S2 Pro를 90점 차이로 앞섰습니다. Breeze TTS 2는 고품질 음성 생성과 50개 언어 지원을 제공하지만, S2 Pro보다 호스팅 속도가 느리고 비용이 더 많이 듭니다.
- • Breeze TTS 2는 현재 Artificial Analysis Provider Voices Speech Arena에서 선두를 달리는 오픈 웨이트 텍스트-음성 변환 모델입니다.
- • Elo 1,215점을 기록하여 이전 1위인 Fish Audio S2 Pro보다 90점 높습니다.
- • 이 모델은 50개 언어를 지원하며 Hugging Face에서 이용할 수 있습니다.
- • Breeze TTS 2는 100만 문자당 34달러에 초당 45자를 처리하며, Fish Audio S2 Pro는 100만 문자당 15달러에 초당 102자를 처리합니다.
개발자들은 음성 기능을 위한 새로운 최고 성능의 오픈 웨이트 옵션을 얻게 되었으나, 이전 1위 모델과 비교하여 우수한 품질과 성능 및 비용 간의 절충안을 고려해야 합니다.
5. Qwen3.8-Flash-Next 출시 예정, 높은 메모리 요구 사항 예상
초기 커뮤니티 논의에 따르면, 이 모델의 아키텍처는 개발자가 충분한 하드웨어를 갖추고 있다면 가중치가 공개된 후 로컬 환경에서 매우 유용할 수 있습니다. Unsloth는 사용자들에게 출시 전 디스크 공간을 확보할 것을 권고했습니다.
- • Qwen3.8-Flash-Next는 내일 출시될 예정이며, Unsloth가 출시 당일 지원을 발표했습니다.
- • 실제 4비트 양자화 시 약 80~90GB의 메모리가 필요할 것으로 예상됩니다.
- • 메모리 점유율은 메인 가중치 약 58GB와 n-gram 테이블 24GB로 구성됩니다.
- • 모델의 대형 n-gram 테이블은 드물게 액세스되므로 시스템 RAM 오프로드 후보가 될 수 있습니다.
이 모델을 직접 호스팅하려는 개발자는 상당한 디스크 공간과 고사양 VRAM 하드웨어 구성을 준비해야 합니다.
6. 익명의 Ox Alpha 모델, OpenRouter 출시 기록 경신
출처나 학습 데이터에 대한 공식 메타데이터가 부족함에도 불구하고, Ox Alpha 모델은 무료이며 호환 가능한 API 엔드포인트 덕분에 개발자들 사이에서 엄청난 채택을 이끌어냈습니다.
- • OpenCode 사용자는 출시 첫 4일 동안 Ox Alpha 모델을 통해 26조 개의 토큰을 처리했습니다.
- • 이 모델은 327,000명 이상의 고유 사용자와 830만 건 이상의 완료된 세션을 기록했습니다.
- • Ox Alpha는 현재 OpenAI 호환 엔드포인트를 통해 무료로 제공됩니다.
- • OpenCode 모델 페이지에는 제작자, 출시일, 지식 차단일 또는 출력 제한 메타데이터가 나열되어 있지 않습니다.
개발자들은 매우 인기 있는 무료 OpenAI 호환 엔드포인트를 워크플로우에 통합할 수 있지만, 모델에 대한 메타데이터는 여전히 부족한 상태입니다.
7. Perplexity, 로컬 에이전트 실행을 위한 휴대용 컴퓨터 출시
Portable Computer는 에이전트 하네스, 오케스트레이터, 플래너, 도구 라우터 및 사전 학습된 모델을 단일 패키지 애플리케이션으로 통합합니다. 현재 Pro, Max 또는 Enterprise 구독을 사용하는 Linux 사용자에게 제공되며, Windows 지원은 9월로 예정되어 있습니다. Perplexity의 53개 작업 로컬 지식 워크벤치에서 이 플랫폼은 PPLX 27B 모델을 사용하여 85.4%의 점수를 기록하며 문서 이해 및 웹 조사 분야에서 Pi 및 Hermes와 같은 기존 오픈 소스 하네스를 능가했습니다.
- • Perplexity는 로컬 모델, 에이전트 하네스 및 보안 샌드박스를 번들로 제공하는 로컬 우선 에이전트 플랫폼인 Portable Computer를 출시했습니다.
- • 이 플랫폼은 최소 24GB VRAM이 필요한 Nvidia RTX GPU 또는 DGX Spark 하드웨어를 갖춘 Linux 머신에서 실행됩니다.
- • 출시 시 지원되는 모델은 Qwen 3.8 27B와 PPLX 27B이며, 향후 Nvidia의 Nemotron 3.5 Lightning이 추가될 예정입니다.
- • 코드 및 도구 실행은 파일 시스템 및 네트워크 액세스를 제한하는 OS 강제 샌드박스 내에서 발생합니다.
- • 하이브리드 기능을 통해 사용자는 PII 확인 후 Claude Opus 5와 같은 클라우드 기반 프론티어 모델로 복잡한 작업을 이관할 수 있습니다.
개발자는 민감한 데이터를 안전하게 유지하면서 토큰당 클라우드 비용을 지불하지 않고도 복잡한 에이전트 워크플로우를 자신의 하드웨어에서 로컬로 실행할 수 있습니다.
8. Headlong, 지속적 에이전트를 위한 Bash 기반 마이크로하네스 오픈 소스 공개
Laude Institute 팀은 이 프레임워크를 사용하여 Audel이라는 공유 에이전트를 테스트했으며, git 브랜치 감사, 코드 검토, 인간의 개입 없이 버그를 스스로 수정하는 등의 기능을 입증했습니다. Headlong은 GitHub에 알파 연구 소프트웨어로 출시되었으며 한 줄 설치 스크립트를 제공합니다. 사용자는 지출 한도가 설정된 API 키를 사용하여 샌드박스 환경에서 실행할 것을 권장합니다.
- • Headlong은 10,000줄 미만의 Bash 코드로 작성된 오픈 소스 에이전트 마이크로하네스입니다.
- • 반응형 에이전트와 달리 Headlong 에이전트는 외부 입력 없이 독립적으로 사고와 프로젝트를 생성합니다.
- • 이 프레임워크는 메모리를 관리하기 위해 이전 궤적 항목을 점진적으로 요약하는 압축 알고리즘을 사용합니다.
- • 에이전트의 궤적은 JSONL 파일의 DAG로 저장되어 사고와 행동의 구조화된 기록을 제공합니다.
- • Headlong 에이전트를 지속적으로 실행하는 비용은 모델과 빈도에 따라 시간당 1~2달러입니다.
개발자는 외부 트리거 없이 지속적으로 실행되는 자율적이고 스스로 수정하는 에이전트를 배포할 수 있습니다.
9. Anthropic, Claude Chat과 Claude Cowork의 메모리 시스템 통합
공유 메모리 기능은 사용자가 프로젝트 세부 정보, 선호도 및 컨텍스트를 반복해서 입력하지 않도록 돕습니다. Claude는 기본적으로 건강, 종교, 정치와 같은 민감한 주제를 저장하지 않으며, 범죄 기록이나 식별 번호와 같은 특정 카테고리는 절대 저장되지 않습니다.
- • Anthropic은 Claude Chat과 Claude Cowork의 메모리 시스템을 통합하여 양방향 컨텍스트 공유를 가능하게 했습니다.
- • Claude는 이제 세션 종료 후 요약하는 대신 대화 중에 동적으로 메모리에 주제를 추가합니다.
- • 메모리 기능은 웹, 데스크톱 및 모바일 플랫폼의 Free, Pro, Max 플랜에서 기본적으로 활성화됩니다.
- • Enterprise 및 Teams 티어 사용자의 경우 메모리 기능은 기본적으로 비활성화되어 있으며 조직의 자격 요건에 따라 달라집니다.
- • 사용자는 설정 메뉴의 메모리 섹션을 통해 저장된 주제를 관리, 보기, 편집 또는 삭제할 수 있습니다.
Claude와 Cowork를 사용하는 개발자는 AI에게 프로젝트 세부 정보를 반복적으로 설명할 필요 없이 워크플로우 전반에서 통합된 컨텍스트를 유지할 수 있습니다.
10. Keenable, AI 에이전트에 최적화된 웹 검색 인덱스 출시
전 Yandex 임원 Andrey Styskin과 AI 과학자 Matthias Petri가 설립한 Keenable은 AI 에이전트를 위해 검색 인프라를 최적화하는 것을 목표로 합니다. 이 회사는 현재 미국과 유럽 전역에 15명의 엔지니어링 직원을 두고 있으며 연말까지 인력을 두 배로 늘릴 계획입니다.
- • Keenable은 AI를 위한 웹 검색 인프라를 구축하기 위해 Accel이 주도하는 2,600만 달러의 시드 펀딩을 받아 스텔스 모드에서 벗어났습니다.
- • 이 스타트업은 1,000억 개 이상의 문서를 포함하는 웹 검색 인덱스를 개발했습니다.
- • Keenable의 API는 현재 음성 AI 기업 Gradium을 포함한 여러 AI 연구소와 추론 제공업체에서 프로덕션 환경에 사용되고 있습니다.
- • 이 회사는 AI 시스템이 여러 웹 소스에서 정보를 합성할 수 있도록 돕는 독점적인 웹 쿼리 언어를 개발 중입니다.
- • Keenable은 특정 작업에 맞게 인덱스 구조를 미세 조정하여 에이전트 쿼리에 대해 더 비용 효율적인 솔루션을 제공한다고 주장합니다.
RAG 또는 에이전트 검색 워크플로우를 구축하는 개발자는 기존 검색 엔진 대신 비용 효율적이고 작업에 최적화된 검색 API를 사용할 수 있습니다.
11. Workflow, AI 파이프라인을 위한 드래그 앤 드롭 캔버스 출시
이 도구는 각 노드에서 중간 출력을 볼 수 있게 하여 AI 파이프라인 구축 및 디버깅 과정을 단순화합니다. Spaces와의 원활한 통합 및 자동 REST API 생성 기능은 빠른 프로토타이핑을 위한 매우 생산적인 도구입니다.
- • Workflow는 AI 파이프라인 구축을 위한 드래그 앤 드롭 캔버스를 제공합니다.
- • 이 플랫폼은 파이프라인의 모든 노드가 독립적으로 실행되도록 하면서 중간 출력을 볼 수 있게 합니다.
- • Workflow는 Spaces에 대한 단일 명령 배포를 지원합니다.
- • Workflow 캔버스에서 생성된 전체 그래프는 REST API로 기능합니다.
개발자는 복잡한 AI 그래프를 빠르게 프로토타이핑하고 단일 명령으로 Spaces에 배포하여 모든 노드를 독립적인 API로 노출할 수 있습니다.
12. Maiao, GitHub 및 GitLab을 위한 Gerrit 스타일 스택형 풀 리퀘스트 지원
Maiao는 GitHub 및 GitLab에서 사용 가능한 경우 네이티브 스태킹 기능과 통합되어 점진적인 개선으로 처리합니다. 또한 자체 호스팅 인스턴스에 대한 수동 구성을 지원하여 다양한 팀 워크플로우에 매우 적응력이 뛰어납니다.
- • Maiao는 adevinta/maiao의 커뮤니티 유지 관리 포크이며 현재 runetes/maiao에서 호스팅됩니다.
- • 이 도구는 브랜치의 커밋당 하나의 PR/MR을 부모-자식 의존성으로 생성하여 스택형 풀 또는 병합 리퀘스트를 가능하게 합니다.
- • 주요 기능으로는 자동 스태킹, git 훅을 통한 Change-ID 추적, 병합 시 자동 리베이스, git commit --fixup 지원이 있습니다.
- • Maiao는 원격 URL에서 git 제공업체를 자동 감지하며 GitHub, GitLab, Gitea, Forgejo, Bitbucket Cloud 및 Cursor Origin을 지원합니다.
- • 이 프로젝트는 오픈 소스이며 MIT 라이선스로 배포됩니다.
개발자는 개별 커밋을 부모-자식 풀 리퀘스트로 자동 스태킹하여 복잡하고 의존적인 코드 변경 사항을 더 효율적으로 관리할 수 있습니다.
13. Liquid AI, Pipette 온디바이스 벤치마킹 제품군 출시
품질 지표는 NVIDIA H100 참조 시스템에서 평가되고 온디바이스 성능 데이터와 일치됩니다. 테스트 방법론에는 고정 토큰 모양, 탐욕적 디코딩 및 열/부하 조건 검증이 포함되며, MacBook Pro(M5 Max 탑재) 및 iPhone 17 Pro와 같은 장치에 대한 초기 검증 결과가 게시되었습니다.
- • Liquid AI는 엣지 장치에서 파운데이션 모델을 벤치마킹하기 위한 오픈 소스 플랫폼인 Pipette을 출시했습니다.
- • 이 플랫폼은 독립적인 방법론 검증을 제공하기 위해 Artificial Analysis와 협력하여 개발되었습니다.
- • Pipette은 모델, 양자화, 런타임 및 장치를 포함한 전체 배포 구성을 기반으로 성능을 측정합니다.
- • 출시 데이터 세트는 macOS, iOS, Windows 및 Android에 걸쳐 30개 이상의 모델에 대한 1,000개 이상의 구성을 다룹니다.
- • Pipette은 Apache 2.0 라이선스로 출시되었으며 공개 결과 데이터 세트, 대시보드 및 네이티브 벤치마크 앱을 포함합니다.
엣지 장치에 모델을 배포하는 개발자는 Pipette을 사용하여 다양한 하드웨어 및 양자화 구성 전반에서 검증된 독립적인 성능 데이터를 얻을 수 있습니다.
14. 추측적 프로그래밍 도구 호출, 재귀적 LLM 지연 시간 최적화
계산과 실행 시간을 겹침으로써 sPTC는 에이전트 워크플로우의 지연 시간 병목 현상을 해결합니다. 이는 고지연 외부 도구나 재귀적 컨텍스트 생성에 의존하는 시스템에 특히 효과적입니다.
- • 추측적 프로그래밍 도구 호출(sPTC)은 토큰 생성 중에 도구 호출을 미리 시작하여 재귀적 언어 모델을 최적화합니다.
- • 이 방법은 JIT 컴파일러와 유사하게 작동하여 1~1.2배의 런타임 속도 향상을 제공합니다.
- • sPTC는 비차단 도구 호출의 병렬 실행을 허용하여 고지연 도구와 관련된 지연 시간을 줄입니다.
- • 이 기술은 메모리 제한적인 로컬 LLM 및 대용량 서빙 시스템의 성능을 향상하도록 설계되었습니다.
개발자는 고지연 외부 도구에 의존하는 재귀적 언어 모델 워크플로우의 지연 시간을 크게 줄일 수 있습니다.
15. 보안 연구, Android C2PA 카메라 앱의 취약점 노출
Pixel Camera 앱은 C2PA 적합성 프로그램에서 가장 높은 보안 등급인 Assurance Level 2를 보유하고 있습니다. Buchanan의 연구에 따르면 Key Attestation 또는 Play Integrity에 의존하는 모든 C2PA 적합 Android 앱도 유사하게 취약하므로 개발자는 Android 장치의 C2PA 서명을 완전히 신뢰할 수 없습니다.
- • 연구원 David Buchanan은 Android의 C2PA 카메라 앱이 루트 권한 상승(LPE) 익스플로잇으로 인한 변조에 취약함을 입증했습니다.
- • 장치가 루팅되면 공격자는 'keystork'라는 도구를 사용하여 하드웨어 기반 StrongBox를 통해 C2PA 키로 임의 데이터를 서명할 수 있습니다.
- • 하드웨어 결함 주입 공격은 하드웨어 수준에서 Android 장치를 루팅할 수 있어 이러한 취약점을 현실적으로 패치하는 것은 불가능합니다.
- • CVE-2026-43499와 같은 소프트웨어 기반 LPE 익스플로잇은 완전히 패치된 Google Pixel 장치를 원클릭으로 루팅할 수 있게 합니다.
- • Google은 취약점 보고서를 '수정 불가(실현 불가능)' 상태로 종결했지만 7,500달러의 포상금을 지급했습니다.
이미지 진위 여부를 위해 C2PA 메타데이터에 의존하는 개발자는 하드웨어 및 소프트웨어 수준의 루트 익스플로잇이 공격자로 하여금 서명을 위조하게 할 수 있다는 사실을 고려해야 합니다.
16. 분석 결과, 전문가 LLM 위험 순위와 실제 사고 간의 불일치 확인
2026년 8월 4일에 발표된 OWASP GenAI LLM Top 10 2026은 실무자 투표에 75%, 사고 데이터에 25%의 가중치를 둡니다. 이 연구는 지속적 메모리 오염 및 MCP 도구 인터페이스 악용과 같은 일부 카테고리는 사고 기록이 적음에도 불구하고 여전히 높음 및 치명적 CVE 등급을 받으므로 외부 승인 게이트가 중요한 방어 수단임을 시사합니다.
- • arXiv의 분석은 전문가 LLM 위험 순위와 실제 사고 데이터를 비교했으며 통계적으로 감지 가능한 일치도가 없음을 발견했습니다(Cohen's kappa 0.20).
- • 프롬프트 인젝션은 전문가들에 의해 1위로 평가되지만 사고 기록에서는 12위에 불과하며, 이는 표준 스캐너에 보이지 않기 때문일 가능성이 높습니다.
- • 허위 정보는 전문가들에 의해 13위로 평가되지만 실제 사고에서는 2위로 평가되어 가장 큰 불일치를 보입니다.
- • Steve Wilson은 에이전트가 승인되지 않은 인프라 변경을 실행하지 못하도록 LLM 외부에 승인 게이트를 구현할 것을 권장합니다.
- • CrowdStrike의 2026년 글로벌 위협 보고서는 2025년 90개 이상의 조직에서 악의적인 프롬프트 인젝션을 기록했습니다.
개발자는 프롬프트 인젝션과 같은 보이지 않는 공격이 공개 사고 기록에서 과소 보고될 수 있음을 이해함으로써 보안 노력을 더 잘 우선순위화할 수 있습니다.
17. SWE Refactor Bench, 리포지토리 마이그레이션에 대한 코딩 에이전트 평가
이 벤치마크는 복잡한 다단계 리포지토리 마이그레이션에 직면했을 때 코딩 에이전트의 현재 한계를 강조합니다. 낮은 생존율은 에이전트가 로컬 편집에는 뛰어나지만 전체 스택 마이그레이션은 여전히 중요한 과제임을 나타냅니다.
- • Einsia는 장기적인 전체 리포지토리 소프트웨어 스택 마이그레이션에 대해 코딩 에이전트를 평가하기 위해 SWE Refactor Bench를 출시했습니다.
- • 이 벤치마크에는 SQLite, zlib, libsodium 및 GraphHopper와 같은 프로젝트 전반에 걸친 20개의 실제 마이그레이션 작업이 포함되어 있습니다.
- • 작업은 C에서 Rust로, Maven에서 Gradle로, POSIX에서 WebAssembly로의 복잡한 마이그레이션을 테스트합니다.
- • 총 520번의 실행 중 28번만 3단계를 모두 통과하여 5.4%의 낮은 생존율을 보였습니다.
- • 벤치마크에 포함된 20개 작업 중 13개는 테스트된 어떤 에이전트로도 해결되지 않았습니다.
개발자는 이 벤치마크를 사용하여 코딩 에이전트가 장기적인 다단계 마이그레이션 작업을 얼마나 잘 처리하는지 현실적으로 평가할 수 있습니다.
18. 벤치마크, 도구 호출에 대한 Qwen3.6-35B-A3B 변형 평가
이 벤치마크는 Ornith 1.5 및 Tiel-Coder와 같은 미세 조정된 변형이 기본 Qwen3.6-35B-A3B 모델보다 상당한 도구 호출 개선을 제공함을 강조합니다. 그러나 Qwen3.8-27B 모델은 도구 중심의 에이전트 워크플로우에 여전히 더 우수한 선택입니다.
- • Ornith 1.5와 Tiel-Coder는 tool-eval-bench 2.6.0을 사용한 도구 호출 벤치마크에서 가장 성능이 좋은 Qwen3.6-35B-A3B 변형이었습니다.
- • 두 상위 변형 모두 Qwen3.6-27B보다는 높은 점수를 받았지만, 평균 152.6점으로 가장 높은 점수를 기록한 Qwen3.8-27B보다는 낮았습니다.
- • 원본 Qwen3.6-35B-A3B는 131.5점으로 테스트된 모델 중 가장 낮은 점수를 기록했습니다.
- • 테스트 과정에는 32GB V100 하드웨어에서 300시간 이상의 GPU 시간을 사용하여 13개의 GGUF 파일에 걸쳐 65번의 실행이 포함되었습니다.
- • 모델은 262,144의 컨텍스트 길이와 50% 컨텍스트 압력을 사용하여 llama.cpp 버전 0.1.0-dev로 실행되었습니다.
도구 호출 작업을 위해 모델을 선택하는 개발자는 이러한 벤치마크 결과를 사용하여 가장 성능이 좋은 미세 조정 변형을 선택할 수 있습니다.
19. Papers with Code, 하이브리드 검색 엔진 아키텍처 상세 공개
검색 인프라는 Papers with Code 웹사이트의 관련 논문 기능을 구동합니다. pgvector를 Qwen 임베딩 및 Hugging Face 도구와 결합함으로써 이 아키텍처는 프로덕션 검색을 위한 매우 실용적이고 오픈 소스 친화적인 스택을 보여줍니다.
- • Papers with Code 검색 엔진은 데이터 관리를 위해 pgvector 확장이 포함된 PostgreSQL을 사용하여 구축되었습니다.
- • 이 시스템은 임베딩을 생성하기 위해 Alibaba Qwen 3-Embedding-0.6B 모델을 활용합니다.
- • 임베딩은 Hugging Face Jobs로 구동되는 NVIDIA L4 GPU에서 계산됩니다.
- • 검색 엔진은 최적의 검색 결과를 얻기 위해 하이브리드 검색을 구현합니다.
- • 라이브 임베딩 엔드포인트는 Hugging Face Inference Endpoints를 통해 제공되며 시스템 아티팩트는 버킷에 저장됩니다.
개발자는 RAG 및 문서 검색 애플리케이션을 위해 이 검증된 프로덕션급 하이브리드 검색 스택을 복제할 수 있습니다.
20. Apple, M5 Max 및 M5 Ultra 칩을 탑재한 Mac Studio 발표
Mac Studio는 Siri AI와 Apple Intelligence가 포함된 macOS 27에서 실행됩니다. Wi-Fi 7, Bluetooth 6 및 Thunderbolt 5 연결을 도입했습니다. 가격은 M5 Max 모델이 2,499달러, M5 Ultra 모델이 5,499달러부터 시작합니다.
- • Apple은 M5 Max 및 M5 Ultra 칩을 탑재한 새로운 Mac Studio를 발표했으며, 2026년 8월 25일부터 사전 주문이 시작되고 2026년 9월 22일에 일반 출시됩니다.
- • M5 Ultra 모델은 최대 512GB 통합 메모리, 36코어 CPU 및 최대 80코어 GPU를 지원합니다.
- • M5 Max 모델은 2,499달러부터 시작하며 18코어 CPU, 최대 40코어 GPU 및 최대 128GB 통합 메모리를 포함합니다.
- • 여러 Mac Studio 시스템을 Thunderbolt 5를 사용하여 클러스터링하면 최대 3배 더 빠른 AI 추론 성능을 달성할 수 있습니다.
- • 새로운 Mac Studio는 이전 세대 대비 최대 4.3배 빠른 AI 성능과 2배 빠른 저장 장치 성능을 제공합니다.
개발자는 최대 512GB의 통합 메모리를 사용하여 단일 워크스테이션에서 대규모 로컬 LLM 및 MoE 모델을 실행할 수 있습니다.
21. Apple, M6 및 M5 Pro 칩을 탑재한 Mac mini 공개
새로운 Mac mini는 Siri AI와 확장된 Apple Intelligence 기능을 도입한 macOS 27에서 실행됩니다. M5 Pro 모델은 Thunderbolt 5 포트를 특징으로 하며, 두 모델 모두 Wi-Fi 7, Bluetooth 6 및 2.5Gb 이더넷을 포함합니다. 이 장치는 인클로저에 100% 재활용 알루미늄을 포함하여 50% 재활용 재료로 제작되었습니다.
- • Apple은 M6 및 M5 Pro 칩을 탑재한 새로운 Mac mini를 발표했으며, 2026년 8월 25일부터 사전 주문이 시작되고 2026년 9월 22일에 일반 출시됩니다.
- • M6 탑재 Mac mini는 899달러부터 시작하며 12코어 CPU와 각 코어에 신경 가속기가 있는 12코어 GPU를 포함합니다.
- • M5 Pro 모델은 1,699달러부터 시작하며 307GB/s 대역폭으로 최대 64GB 통합 메모리를 지원합니다.
- • 업데이트된 Mac mini는 이전 세대보다 최대 2배 빠른 성능을 제공하는 듀얼 16코어 Neural Engine을 특징으로 합니다.
- • 기본 모델은 16GB 표준 통합 메모리와 함께 제공되며 최대 32GB까지 구성 가능하고 최대 170GB/s 메모리 대역폭을 제공합니다.
로컬 모델을 실행하는 개발자는 크게 업그레이드된 신경 엔진과 메모리 대역폭을 갖춘 매우 컴팩트하고 비용 효율적인 데스크톱 옵션을 얻게 됩니다.
22. NVIDIA, 엣지 AI 및 로봇 공학을 위한 Jetson Orin Nano 2 도입
Wing 및 Matic Robots와 같은 기업들은 이미 드론 및 가정용 로봇을 위해 Jetson Orin Nano 2를 평가하고 있습니다. 이 하드웨어는 현재 전 세계 300만 명 이상의 개발자와 10,000개 이상의 기업에서 사용 중인 NVIDIA의 로봇 공학 스택과 통합됩니다.
- • NVIDIA는 78 TOPS의 AI 컴퓨팅, 8GB 메모리 및 8코어 Arm CPU를 특징으로 하는 Jetson Orin Nano 2를 도입했습니다.
- • 이 장치는 동일한 컴팩트 폼 팩터 내에서 Jetson Orin Nano Super의 추론 성능을 두 배로 높입니다.
- • 15와트 모드에서 이 시스템은 이전 모델보다 40% 적은 전력을 소비하면서 동등한 최고 성능을 제공합니다.
- • 이 하드웨어는 NVIDIA Cosmos, Nemotron, Gemma 4 및 Qwen 3를 포함한 오픈 모델을 기본적으로 지원합니다.
- • NVIDIA는 2027년 상반기에 모듈과 개발자 키트를 제공할 계획입니다.
엣지 AI, 드론 또는 로봇 애플리케이션을 구축하는 개발자는 매우 효율적이고 컴팩트한 하드웨어 모듈에서 더 큰 오픈 모델을 로컬로 배포할 수 있습니다.
23. Llama.cpp 포크, 더 빠른 추론을 위한 적응형 추측 도입
토큰 제안을 동적으로 조정함으로써 적응형 추측 기능은 추론 엔진의 성능을 즉석에서 최적화합니다. 이는 소비자 하드웨어에서 로컬 LLM을 실행하는 개발자에게 상당한 속도 향상을 제공합니다.
- • Llama.cpp의 새로운 포크는 Qwen3.8과 같은 모델의 성능을 최적화하기 위해 적응형 추측을 도입했습니다.
- • 적응형 추측은 콘텐츠 유형에 따라 최소 및 최대 토큰 제안 값을 자동으로 조정합니다.
- • 이 기능은 메인라인 Llama.cpp 대비 토큰 생성 속도를 최대 50% 향상합니다.
- • Strix Halo 시스템에서 이 구현은 구조화된 콘텐츠에 대해 생성 속도를 44t/s에서 65t/s로 증가시켰습니다.
로컬 모델을 실행하는 개발자는 하드웨어를 업그레이드하지 않고도 특히 구조화된 콘텐츠에 대해 훨씬 더 빠른 추론 속도를 달성할 수 있습니다.