铭鸿体育资讯网

此前和 agent 实测发现,Jev 会上下文学习,给它例子和记录,它能把判断调准;但想让它越玩越强,还得有人帮一把。这次试了几种帮法。 我们的实验用到了「老虎机」,它是测 AI「边试边学」的经典小游戏。有几个按钮,每个中奖概率固定,但 AI 事先不知道,只能从按出来的结果里摸索出哪个最容易中。 ​

此前和 agent 实测发现,Jev 会上下文学习,给它例子和记录,它能把判断调准;但想让它越玩越强,还得有人帮一把。这次试了几种帮法。

我们的实验用到了「老虎机」,它是测 AI「边试边学」的经典小游戏。有几个按钮,每个中奖概率固定,但 AI 事先不知道,只能从按出来的结果里摸索出哪个最容易中。

1️⃣ 怎么选:多试几个选项。让 Jev 自己玩老虎机,每轮把这局前面按过的结果交给它,它照着这些记录给每个按钮一个概率。若程序每轮只按概率最高的那个,没玩几轮就只按同一个按钮。最好的按钮没按过,或只按一两次没中,记录里看不出它好,Jev 也就一直不选它。我们之前用 Jev 打游戏也是这么选的,这回给自己打个补丁。多试有两个办法:程序改成按概率抽着选,后期按到最好按钮的比例从 62% 升到 85%;或者程序仍只按最高的,在问题里提醒 Jev,没试过或试得少的也可能更好,前期多试,升到 78%。这两招不用懂游戏规则,换个游戏也可以先试。

2️⃣ 怎么喂:记录写成「这种情况该按哪个」。猜规则的实验里,每张牌该按左还是按右,由隐藏规则决定。给 Jev 一批随便按出来的对错记录,它判断新牌只猜对 63%,瞎猜也有 50%。同一批记录,程序把每条都改写成正确答案,比如「按了左、错了」写成「这张牌该按右」,再把改好的记录和新牌一起放进 state(材料)交给 Jev,由它对照着判断,升到 87%。只有两个键,错了就是另一边,从「错了」反推该按哪边,程序就能代劳;动作多的游戏,一次失败推不出该怎么做,得靠人或大模型来总结。

3️⃣ 怎么分工:往前推几步交给程序。此前的迷宫实验里,Jev 读了踩坑记录多半能躲开已知的坑,却常绕不出去。程序每步标出各个方向离终点几步:只按墙算,通关率只有 4%;把踩过的坑也当墙算,前两局各踩一个坑,之后全通,通关率 60%(见图)。这组越玩越好的是整套系统,出力最多的是程序。把 Jev 换成只会挑最小步数的程序来走,赢面相同。Jev 读踩坑记录也出了点力,只删掉记录,通关率降到 50%。步数是照着迷宫地图算的,这类程序得按游戏来配。

所以,Jev 自己能学的,是从交给它的记录里把每一步判断调准;记录全不全、写成什么样、哪些活交给程序,得靠人或大模型来安排。此前拆的 Minecraft 屠龙也是这样,变快的是作者一版版改出来的整套系统。

Jev人工智能