铭鸿体育资讯网

华为开源了fable5

训练一个 Agent,有时会出现一件很荒唐的事。

负责生成答案的模型先完成任务,负责训练的模型再根据这个答案计算奖励。两边明明使用同一套参数,对答案的判断却可能不同。一个觉得这句话出现的概率很高,另一个算出来却很低。

等于让一个人参加考试,再拿另一个人的答题过程给他打分。奖励一旦算偏,模型接下来学习的方向也会跟着偏。