训练LLM更新认知,实现高效长周期交互

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

本文对ABBEL与传统递归摘要方法进行了对比概述:该方法以信念替代完整交互历史作为Agent的工作上下文,同时通过监督各信念状态的内容实现信念分级,有效提升了任务表现。

阅读原文 · BAIR →