Ziyu Li's Homepage

Back

文档说明#

本文档记载一次MLE的预训练和极小的微调

实验数据#

从生成的长对话里面提取出来的树,总共100颗,88样本内,12val,树比较大,大概每棵树有150个fact+50个aspect,大概共200个节点

实验过程#

首先是用chatgpt-4o做标注,也就是对每个snapshot的closure,让gpt去决定应该做什么动作,这就得到了所有的(X,y),做监督学习

这些(X,y)做100个epoch的监督学习

结束之后,做online学习,但只做两个policy,online的成本非常高,2个epoch大概跑了10小时

评判结果#

从结构上来说,teacher(gpt)和student(小模型)做出来的树的aspect都比较少,至少比数据集里面的原树少得多

label_plot

用gpt5.6-sol当强模型,直接分别给ref, teacher, student树打分如下(理论上student的分不可能超过teacher)

盘踞大概是这样:假如一棵树有100个fact,LLM去逐个判断每个fact和他父亲的关系的合理性,得到一个百分比,比如说50个fact是合理的,那这个值就是0.5

接下来再做很多次(比如说10次),这10次就把fact随机乱放,然后每次能得到一个百分比,这个百分比大概率很低,因为乱放可能只有5个fact合理,平均可能也是5%左右

然后再考虑超额,超额=树的合理百分比-随机乱放的平均百分比即可

当然了,因为随便乱放的baseline大概率趋于0,也可以不剪掉,直接看合理程度就行了

label_plot

从这个图上可以看出来,teacher的质量其实也一般,或者说teacher在看不到ref_tree的情况下,应该不太可能做到比较好

生产结果#

我们用一棵树,分别展示他的ref/teacher/student

Agent Memory Research In MMLab (Part 4)
https://astro-pure.js.org/blog/memory_part4
Author Ziyu(Albert) Li 李子煜
Published at August 6, 2026
Comment seems to stuck. Try to refresh?✨