0xMarioNawfal (@RoundtableSpace)작은 데스크톱 GPU에서 35B 모델을 10개 에이전트가 동시에 구동하며 74W로 총 436 tok/s를 달성했다는 주장이다. 데이터센터나 클라우드 없이도 고...

0xMarioNawfal (@RoundtableSpace)작은 데스크톱 GPU에서 35B 모델을 10개 에이전트가 동시에 구동하며 74W로 총 436 tok/s를 달성했다는 주장이다. 데이터센터나 클라우드 없이도 고성능 AI 인퍼런스가 가능함을 보여주며, 온디바이스/로컬 AI 인프라의 가능성을 강조한다.https://x.com/RoundtableSpace/status/2048420586192543826#aiinfrastructure #inference #ondevice #llm #agents

Read Original

Related