Mastodon discussion May 22

Chris W (@Chris_Wozniczek)Zhipu가 GLM-5.1 High-Speed API를 공개해 초당 400토큰 출력 속도를 달성했다고 발표했다. 대형 모델 API 응답 지연을 줄이는 데 유의미한 성능 ...

Chris W (@Chris_Wozniczek)Zhipu가 GLM-5.1 High-Speed API를 공개해 초당 400토큰 출력 속도를 달성했다고 발표했다. 대형 모델 API 응답 지연을 줄이는 데 유의미한 성능 개선으로, LLM 서빙·에이전트·실시간 애플리케이션에서 활용 가치가 크다.https://x.com/Chris...

Mastodon discussion May 22

zR (@zRdianjiao)Zai Org의 GLM-5.1-HighSpeed가 초당 400 토큰으로 공개되었습니다. 단순히 작은 모델로 속도를 타협한 것이 아니라, 플래그십급 LLM API에서 새로운 속도 상한을 제...

zR (@zRdianjiao)Zai Org의 GLM-5.1-HighSpeed가 초당 400 토큰으로 공개되었습니다. 단순히 작은 모델로 속도를 타협한 것이 아니라, 플래그십급 LLM API에서 새로운 속도 상한을 제시한 점이 핵심입니다. 고처리량 서빙, 실시간 에이전트, 대화형 제품의 추론 지연 개선에 참고할 만한 소식입...

Mastodon discussion May 21

LLM-mock – Record real LLM API responses once, replay them in tests foreverllm-mock은 실제 LLM API 호출을 한 번 기록하고, 이후 테스트에서 해...

LLM-mock – Record real LLM API responses once, replay them in tests foreverllm-mock은 실제 LLM API 호출을 한 번 기록하고, 이후 테스트에서 해당 응답을 재생하여 API 호출 비용과 비결정성 문제를 해결하는 Python 라이브러리입니다. Anthrop...