Why Answering Every Question Is Wrong: Teaching LLMs When to Clarify and When to Act
中文摘要
通过SFT和DPO训练7B模型识别歧义问题,教导其在需要时寻求澄清而非盲目回答。
English Summary
This study uses SFT and DPO to train a 7B model to distinguish ambiguous questions, teaching LLMs to seek clarification instead of blindly answering.
Original Excerpt
A practical experiment in training a 7B-parameter language model to distinguish ambiguous questions from answerable ones using SFT, DPO… Continue reading on Medium »