返回首页
AI on Medium··行业媒体

Why Answering Every Question Is Wrong: Teaching LLMs When to Clarify and When to Act

中文摘要

通过SFT和DPO训练7B模型识别歧义问题,教导其在需要时寻求澄清而非盲目回答。

English Summary

This study uses SFT and DPO to train a 7B model to distinguish ambiguous questions, teaching LLMs to seek clarification instead of blindly answering.

原文节选

A practical experiment in training a 7B-parameter language model to distinguish ambiguous questions from answerable ones using SFT, DPO… Continue reading on Medium »