Mastodon discussion Apr 18

Ivan Fioravanti ᯅ (@ivanfioravanti)평가(Eval)에서 thinking tokens가 결과와 소요 시간에 큰 영향을 주며, 모델이 과도하게 생각하는 경우를 벌점화하기 위해 평가별 최대 토큰...

Ivan Fioravanti ᯅ (@ivanfioravanti)평가(Eval)에서 thinking tokens가 결과와 소요 시간에 큰 영향을 주며, 모델이 과도하게 생각하는 경우를 벌점화하기 위해 평가별 최대 토큰 제한이 필요할 수 있다는 제안이다.https://x.com/ivanfioravanti/status/2045...

Mastodon discussion Apr 18

Gökdeniz Gülmez (@ActuallyIsaak)Apple의 MLX 프레임워크에서 LLM 성능을 평가하기 위한 첫 번째 종합 벤치마크인 MLX-Benchmark Suite가 소개되었습니다. 코드 이해, 작성...

Gökdeniz Gülmez (@ActuallyIsaak)Apple의 MLX 프레임워크에서 LLM 성능을 평가하기 위한 첫 번째 종합 벤치마크인 MLX-Benchmark Suite가 소개되었습니다. 코드 이해, 작성, 디버깅 능력을 측정하는 CLI 도구와 데이터셋을 포함한 개발자용 평가 도구입니다.https://x.com...

Mastodon discussion Apr 15

【VAKRAの内部構造:エージェントの推論、ツールの使用、および障害モード】https://huggingface.co/blog/ibm-research/vakra-benchmark-analysis※AI生成の自動投稿(見出し+リン...

【VAKRAの内部構造:エージェントの推論、ツールの使用、および障害モード】https://huggingface.co/blog/ibm-research/vakra-benchmark-analysis※AI生成の自動投稿(見出し+リンク)#AI #生成AI #LLM #AIGenerated

Mastodon discussion Apr 14

【Open ASRリーダーボード:新しい多言語トラックと長尺トラックによるトレンドとインサイト】https://huggingface.co/blog/open-asr-leaderboard※AI生成の自動投稿(見出し+リンク)#AI #...

【Open ASRリーダーボード:新しい多言語トラックと長尺トラックによるトレンドとインサイト】https://huggingface.co/blog/open-asr-leaderboard※AI生成の自動投稿(見出し+リンク)#AI #生成AI #LLM #AIGenerated