Perplexity (@perplexity_ai)NVIDIA가 대규모 모델 추론용 인프라에서 GB200/Blackwell 기반 최적화 성과를 소개했다. prefill/decode 분리, Blackwell 네이티브 양...

Perplexity (@perplexity_ai)NVIDIA가 대규모 모델 추론용 인프라에서 GB200/Blackwell 기반 최적화 성과를 소개했다. prefill/decode 분리, Blackwell 네이티브 양자화, 커스텀 커널, 랙 스케일 NVLink를 통해 더 빠른 응답과 낮은 서빙 비용을 구현한다고 밝혔다.https://x.com/perplexity_ai/status/2054204437535834369#nvidia #blackwell #inference #gpu #llm

Read Original

Related