Inference Brew

ByteDance, 30초 생성 및 멀티모달 제어 기능을 갖춘 Seedance 2.5 출시

00:00 / --:--

← 메인으로

ByteDance, 30초 생성 및 멀티모달 제어 기능을 갖춘 Seedance 2.5 출시

1. ByteDance, 30초 생성 및 멀티모달 제어 기능을 갖춘 Seedance 2.5 출시

ByteDance는 Seedance 라인업의 기능을 확장한 Seedance 2.5를 공식 출시했습니다. 이번 버전은 한 번의 패스로 최대 30초 분량의 고품질 오디오-비디오 콘텐츠를 생성할 수 있으며, 최대 30개의 이미지, 10개의 비디오 클립, 10개의 오디오 클립을 동시에 입력할 수 있는 고급 멀티모달 참조 기능을 도입했습니다. 또한 타임스탬프 수준의 편집 제어와 클레이 렌더링 참조 기능도 추가되었습니다. API 액세스는 BytePlus ModelArk를 통해 제공될 예정입니다.

  • Seedance 2.5는 한 번의 패스로 최대 30초 분량의 오디오-비디오 콘텐츠를 생성할 수 있습니다.
  • 새로운 멀티모달 참조 기능은 최대 30개의 이미지, 10개의 비디오 클립, 10개의 오디오 클립을 동시에 입력할 수 있도록 지원합니다.
  • 타임스탬프 수준의 편집, 그린 스크린, 카메라 시점 편집 및 클레이 렌더링 참조 기능을 도입했습니다.
  • Jimeng AI와 Doubao Pro에서 사용할 수 있으며, BytePlus ModelArk API 액세스도 출시될 예정입니다.

이번 업데이트는 이전 2.0 버전의 기능을 뛰어넘어 Seedance 플랫폼을 사용하는 개발자들에게 창의적인 제어 능력과 생성 시간을 크게 향상시켜 줍니다.

SOURCES

2. LongCat-Flash-Lite-Sparse, 100만 토큰 컨텍스트 지원으로 업데이트

어제 발표에 이어 LongCat-Flash-Lite-Sparse 모델의 공식 가중치가 공개되었습니다. 이번 버전은 기존의 밀집형 Multi-Head Latent Attention(MLA)을 대체하는 LongCat Sparse Attention(LSA)을 도입하여, 초기 릴리스에서 보고된 256k 제한에서 크게 증가한 100만 토큰의 네이티브 지원을 가능하게 했습니다.

  • LongCat-Flash-Lite-Sparse 모델 가중치를 이제 다운로드할 수 있습니다.
  • 네이티브 컨텍스트 지원이 100만 토큰으로 확장되었습니다.
  • 아키텍처는 이제 밀집형 Multi-Head Latent Attention(MLA) 대신 LongCat Sparse Attention(LSA)을 사용합니다.

이번 업데이트는 사용 가능한 컨텍스트 윈도우를 4배로 확장함으로써 로컬에서 방대한 문서나 코드베이스를 처리하는 모델의 유용성을 크게 높였습니다.

SOURCES

3. Poolside, Laguna S 2.1을 위한 최적화된 FP8 및 NVFP4 체크포인트 출시

7월 21일에 출시된 Laguna S 2.1 Mixture-of-Experts 모델을 기반으로, Poolside는 업데이트된 FP8 및 NVFP4 체크포인트를 출시했습니다. 구성 수정 사항과 함께 제공되는 이 새로운 가중치는 개발자들에게 100만 토큰 컨텍스트 모델을 배포하기 위한 최적화된 옵션을 제공합니다.

  • Poolside는 Laguna S 2.1 모델을 위한 공식 FP8 및 NVFP4 체크포인트를 출시했습니다.
  • 이번 업데이트에는 새로운 가중치와 함께 구성 수정 사항이 포함되어 있습니다.
  • 이 체크포인트들은 최적화된 추론을 지원하기 위해 다운로드할 수 있습니다.

이러한 양자화 체크포인트는 Laguna S 2.1 모델의 보다 효율적인 로컬 배포와 전문화된 추론 파이프라인을 가능하게 합니다.

SOURCES

4. Solid Queue 1.6.0, I/O 집약적 LLM 워크로드를 위한 Fiber Worker 도입

Solid Queue v1.6.0은 백그라운드 작업이 기존의 스레드 풀 대신 단일 Fiber Reactor 스레드에서 실행될 수 있도록 하는 Fiber Worker 실행 모드를 도입했습니다. 이 실행 모드는 I/O 집약적 워크로드에 최적화되어 있어, 외부 LLM API를 자주 호출하는 애플리케이션에 매우 적합합니다. 이 기능을 사용하려면 개발자는 Fiber 수를 구성하고, Async 종속성을 포함하며, Rails에서 Fiber 격리를 활성화해야 합니다.

  • Solid Queue v1.6.0은 작업을 단일 Fiber Reactor 스레드에서 실행하는 Fiber Worker 실행 모드를 도입했습니다.
  • 이 기능은 특히 LLM 호출과 관련된 I/O 집약적 워크로드를 위해 설계되었습니다.
  • Async 종속성이 필요하며, config.active_support.isolation_level = :fiber를 통해 Rails에서 Fiber 격리를 활성화해야 합니다.
  • 이번 릴리스에는 테스트 중 종료된 작업 스레드에 의해 유출된 트랜잭션을 롤백하는 수정 사항도 포함되어 있습니다.

이를 통해 Rails 개발자는 무거운 스레드 풀 대신 단일 Fiber Reactor 스레드에서 백그라운드 LLM 작업을 실행하여 리소스 효율성을 높일 수 있습니다.

SOURCES

5. llama.cpp, DeepSeek-V4-Flash-0731의 도구 호출 문제 수정

DeepSeek-V4-Flash-0731 모델의 심각한 도구 호출 문제를 해결하기 위해 llama.cpp 메인 저장소에 풀 리퀘스트가 병합되었습니다. 풀 리퀘스트 #26269로 식별된 이 업데이트는 모델 루핑과 잘못된 동작을 수정하여, 로컬 환경에서 모델의 도구 호출 기능을 사용하는 개발자들에게 안정적인 성능을 복구해 줍니다.

  • 풀 리퀘스트 #26269가 llama.cpp 메인 저장소에 병합되었습니다.
  • 이 수정 사항은 도구 호출 중 발생하는 모델 루핑 및 잘못된 동작 문제를 해결합니다.
  • 이번 업데이트는 DeepSeek-V4-Flash-0731을 실행하는 사용자들이 겪던 성능 문제를 해결했습니다.
  • 수정 사항은 저장소의 메인 브랜치에 추가되었습니다.

이 업데이트는 llama.cpp를 통해 로컬에서 DeepSeek-V4-Flash-0731을 실행하는 개발자들에게 신뢰할 수 있는 도구 호출 기능을 복구해 줍니다.

SOURCES

6. 로컬 LLM 벤치마킹 플랫폼 beta.locallm.top 출시

로컬 LLM 벤치마킹을 위한 전용 공간을 제공하는 beta.locallm.top 플랫폼이 출시되었습니다. 이 사이트는 현재 10개 이상의 좁은 도메인 벤치마크와 25개 이상의 소규모 벤치마크를 호스팅하고 있습니다. 개발자는 사용자 지정 벤치마크를 생성하고, 모델 및 시스템 프롬프트 조합(파이프라인)을 정의하며, 응답을 평가하고, 비교 표를 확인할 수 있습니다. 플랫폼의 아키텍처는 모델 실행을 위해 llama-server에 의존하며, 백엔드 API에 의해 조정되고, 데이터 오염을 방지하기 위해 비공개 벤치마크를 지원합니다.

  • 웹사이트 beta.locallm.top이 로컬 LLM 벤치마킹 플랫폼으로 출시되었습니다.
  • 이 플랫폼은 현재 10개 이상의 좁은 도메인 벤치마크와 25개 이상의 소규모 벤치마크를 호스팅합니다.
  • 오염을 완화하고 실험을 허용하기 위해 비공개 벤치마크와 파이프라인을 지원합니다.
  • 시스템 아키텍처는 모델 실행을 위해 llama-server를 사용하며, 백엔드 API와 모델 서비스 릴레이에 의해 조정됩니다.

이를 통해 개발자들은 데이터 오염 없이 사용자 지정 프롬프트에 대한 로컬 모델 성능을 평가할 수 있는 구조화된 비공개 환경을 확보하게 됩니다.

SOURCES

7. Cursor, 셀프 서비스 대시보드에서 달러 기반 비용 추적 제거

Cursor는 개인 및 셀프 서비스 Teams 플랜의 사용량 대시보드와 CSV 내보내기에서 달러 기반 비용 추적 기능을 제거했습니다. 대시보드는 이제 달러 금액 대신 토큰 수를 표시하며, 과거 비용 데이터는 0으로 처리되거나 제거되었습니다. Cursor는 이것이 포함된 플랜 사용량과 온디맨드 요금 간의 혼동을 방지하기 위한 의도적인 설계 선택이라고 밝혔으나, 사용자들은 세부적인 요청별 및 모델 효율성 추적 기능의 상실에 대해 불만을 표하고 있습니다.

  • Cursor는 2026년 7월 31일부터 개인 및 셀프 서비스 Teams 플랜에 대한 달러 기반 비용 추적을 제거했습니다.
  • 사용량 대시보드는 이제 달러 금액 대신 토큰 수를 표시하며, 내보내기 파일의 과거 비용 데이터는 제거되거나 0으로 처리되었습니다.
  • Cursor 담당자 Kevin Neilson은 이번 변경이 포함된 플랜 사용량과 온디맨드 요금 간의 사용자 혼동을 방지하기 위한 것이라고 밝혔습니다.
  • Enterprise 플랜은 영향을 받지 않으며 계속해서 달러 기반 비용 추적을 표시합니다.
  • 사용자는 Spending 대시보드에서 총 청구 주기 비용을 확인하거나 Teams 수준의 지출 데이터를 위해 Admin API를 사용할 수 있습니다.

이로 인해 개발자들은 직접적인 달러 비용 대신 토큰 수를 추적해야 하게 되어, 예산 모니터링과 모델 효율성 분석이 복잡해졌습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.