164 Community LLM Fine-Tunes Tested on Questions They’d Never Seen. Most Scored Worse.
中文摘要
审计发现164个社区微调模型在未见过的测试中表现更差,揭示了严重的模型污染和质量问题。
English Summary
An audit of 164 community fine-tunes revealed most performed worse on unseen questions, exposing significant data contamination and reliability issues.
原文节选
A contamination-controlled audit of HuggingFace fine-tunes, methodology, results, and a headline claim that failed its own validity check. Continue reading on Medium »