返回首页
AI on Medium··行业媒体

164 Community LLM Fine-Tunes Tested on Questions They’d Never Seen. Most Scored Worse.

中文摘要

审计发现164个社区微调模型在未见过的测试中表现更差,揭示了严重的模型污染和质量问题。

English Summary

An audit of 164 community fine-tunes revealed most performed worse on unseen questions, exposing significant data contamination and reliability issues.

原文节选

A contamination-controlled audit of HuggingFace fine-tunes, methodology, results, and a headline claim that failed its own validity check. Continue reading on Medium »