探索式AI评估新范式:TRACES基准实践指南与核心指标解析 在实际 AI 研究和应用开发中我们常常面临一个核心挑战如何客观、量化地评估一个 AI 系统尤其是那些被设计用于“探索”而非简单“回答”的智能体传统的基准测试如 GLUE、SuperGLUE 或 MMLU主要衡量模型在分类、问答、推理等封闭任务上的表现。然而当 AI 被赋予在开放环境中自主探索、试错、学习和规划的能力时——例如在《我的世界》中生存、在复杂游戏中制定策略或是在模拟物理环境中解决多步骤问题——这些静态基准就显得力不从心了。它们无法捕捉智能体在动态、长周期任务中展现出的探索效率、好奇心、泛化能力和持续学习潜力。这正是 TRACES 基准试图解决的问题。作为首个专门为“探索式 AI”设计的系统性评估框架TRACES 将评估焦点从“最终答案是否正确”转向了“智能体如何通过探索过程达成目标”。它旨在为研究人员和开发者提供一个标准化的“考场”用以衡量和比较不同探索算法、好奇心驱动机制、规划策略以及具身智能体在复杂环境中的综合表现。理解并应用 TRACES对于从事强化学习、元学习、自主智能体、游戏 AI 以及具身人工智能等领域工作的工程师和研究者至关重要。本文将带你深入理解 TRACES 的设计理念、核心组件并通过一个具体的实践案例展示如何利用 TRACES 来评估和优化你自己的探索式 AI 模型。1. 理解探索式 AI 与 TRACES 基准的设计动机在深入技术细节之前我们需要厘清“探索式 AI”究竟是什么以及为什么它需要一套全新的评估标准。1.1 什么是探索式 AI探索式 AI 指的是那些能够在信息不完全、奖励稀疏或延迟、环境动态变化的情况下通过主动尝试、收集信息、构建内部模型并规划行动序列以实现长期目标的智能系统。它与传统“推理式 AI”或“判别式 AI”的关键区别在于过程导向 vs. 结果导向探索式 AI 强调在达成目标过程中的行为序列、信息获取效率和策略适应性而不仅仅是最终结果的正确性。主动学习 vs. 被动响应它需要主动与环境交互提出假设并验证而非仅仅对给定的输入做出反应。长期规划 vs. 即时决策其决策往往基于对未来状态的预测和长期回报的估计涉及多步骤的规划。典型的探索式 AI 应用场景包括游戏 AI在《我的世界》、《星际争霸》、《DOTA 2》等开放或复杂策略游戏中智能体需要探索地图、收集资源、制定长期战略。机器人控制让机器人在未知环境中导航、操作物体需要大量的试错和物理交互探索。科学发现AI 被用于设计实验、筛选材料或提出科学假设本质上是一个探索未知参数空间的过程。推荐系统探索在保证用户体验的同时尝试推荐用户可能感兴趣的新内容平衡“利用”已知偏好和“探索”潜在兴趣。1.2 传统基准的局限性现有的 AI 基准大多围绕以下范式构建静态数据集输入和预期输出是固定的。即时评估模型给出输出后立即与标准答案对比得到分数。独立同分布假设测试数据与训练数据来自同一分布。这些范式无法有效评估探索式 AI因为环境是动态的智能体的行动会改变环境状态评估需要在交互序列中进行。奖励是稀疏和延迟的成功可能需要成千上万步中间几乎没有正向反馈。成功路径不唯一可能存在多种策略都能达成目标需要评估策略的质量和效率。需要衡量泛化智能体在训练环境中的表现需要能泛化到稍有变化的新环境或新任务。1.3 TRACES 的核心设计原则TRACES 基准正是为了克服上述局限性而设计的。其名称可能寓意着追踪智能体在环境中的“轨迹”和“足迹”。其核心设计原则包括任务复杂性包含需要多步骤推理、工具使用和环境交互的任务。探索必要性任务的成功完成必须依赖于智能体主动获取新信息而非仅靠先验知识。可重复性与标准化提供统一的环境接口、初始状态和评估脚本确保不同智能体之间的公平比较。多维评估指标不仅仅看最终成功率还评估探索效率、样本复杂度、泛化能力、好奇心表现等。一个典型的 TRACES 任务可能设定为“在一个部分未知的迷宫中找到隐藏的宝藏。迷宫每次重置布局相似但不同智能体需要先探索地图结构记住关键位置然后规划路径。”2. 环境准备与 TRACES 基准安装要使用 TRACES 进行评估首先需要搭建相应的运行环境。由于 TRACES 可能涵盖多种模拟环境如 GridWorld、MiniGrid、Crafter、BabyAI 或自定义的 Gymnasium 环境以下步骤以通用的 Python 强化学习环境为例。2.1 基础环境配置建议使用 Python 3.8-3.10 版本并使用虚拟环境进行隔离。# 创建并激活虚拟环境 (以 conda 为例) conda create -n traces_benchmark python3.9 conda activate traces_benchmark # 或者使用 venv python -m venv traces_env source traces_env/bin/activate # Linux/Mac # traces_env\Scripts\activate # Windows2.2 安装核心依赖TRACES 基准的实现通常依赖于强化学习标准库。以下是可能需要的核心包# 安装基础科学计算和深度学习框架 pip install numpy pandas matplotlib seaborn pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu # 根据CUDA版本调整 # 安装强化学习环境标准接口 pip install gymnasium # 安装一些常用于探索基准的环境 pip install minigrid pip install crafter # 安装用于创建自定义环境的库 pip install gymnasium[box2d] gymnasium[classic_control] # 安装强化学习算法库例如用于构建待评估的智能体 pip install stable-baselines3[extra] pip install ray[rllib] # 可选用于分布式训练2.3 获取 TRACES 基准代码假设 TRACES 基准托管在 GitHub 上根据输入材料中的项目开源链接模式推断我们需要克隆其代码库。# 克隆仓库此处为示例仓库实际需替换为 TRACES 官方仓库 git clone https://github.com/TRACES-org/TRACES-benchmark.git cd TRACES-benchmark # 安装基准测试包本身如果提供了 setup.py 或 requirements.txt pip install -e . # 可编辑模式安装方便修改 # 或 pip install -r requirements.txt关键检查点安装完成后运行一个简单的导入测试确保核心模块可用。# test_import.py import gymnasium import minigrid from traces import make_env # 假设 TRACES 提供了 make_env 函数 print(“环境包导入成功”)执行python test_import.py不应报错。2.4 目录结构理解了解 TRACES 基准的典型目录结构有助于后续使用TRACES-benchmark/ ├── traces/ # 核心基准代码 │ ├── __init__.py │ ├── envs/ # 封装好的标准环境 │ │ ├── __init__.py │ │ ├── exploration_gridworld.py │ │ └── crafting_task.py │ ├── evaluation/ # 评估脚本和指标计算 │ │ ├── evaluator.py │ │ └── metrics.py │ └── utils/ # 工具函数 ├── configs/ # 环境与评估的配置文件 │ └── default.yaml ├── agents/ # 官方或示例智能体实现可选 │ └── random_agent.py ├── scripts/ # 启动训练和评估的脚本 │ ├── run_evaluation.py │ └── train_baseline.py ├── requirements.txt └── README.md3. 使用 TRACES 评估一个简单的探索智能体现在我们将实现一个最简单的智能体随机智能体并使用 TRACES 框架对其进行评估以熟悉整个工作流程。3.1 创建一个自定义探索环境示例TRACES 可能提供标准环境但理解如何创建符合其接口的自定义环境至关重要。以下是一个简单的“稀疏奖励迷宫”环境示例# custom_exploration_env.py import gymnasium as gym from gymnasium import spaces import numpy as np class SparseRewardMaze(gym.Env): 一个简单的网格迷宫环境智能体需要探索找到目标。 metadata {render_modes: [human]} def __init__(self, size5, max_steps100): super().__init__() self.size size self.max_steps max_steps self.action_space spaces.Discrete(4) # 0:上1:右2:下3:左 # 观察空间智能体当前位置 (x, y) self.observation_space spaces.Box(low0, highsize-1, shape(2,), dtypenp.int32) # 目标位置固定 self.goal_pos np.array([size-1, size-1]) self.agent_pos None self.steps 0 self.render_mode None def reset(self, seedNone, optionsNone): super().reset(seedseed) # 智能体初始位置在左上角 self.agent_pos np.array([0, 0], dtypenp.int32) self.steps 0 return self.agent_pos.copy(), {} # 返回观察和信息字典 def step(self, action): self.steps 1 # 定义移动方向 moves [(-1, 0), (0, 1), (1, 0), (0, -1)] dx, dy moves[action] new_x np.clip(self.agent_pos[0] dx, 0, self.size - 1) new_y np.clip(self.agent_pos[1] dy, 0, self.size - 1) self.agent_pos np.array([new_x, new_y]) # 计算奖励只有到达目标才有1奖励否则为0稀疏奖励 reward 1.0 if np.array_equal(self.agent_pos, self.goal_pos) else 0.0 terminated reward 0 or self.steps self.max_steps truncated False # 本例中不使用 info {steps: self.steps} return self.agent_pos.copy(), reward, terminated, truncated, info def render(self): if self.render_mode human: grid np.full((self.size, self.size), ., dtypestr) grid[self.goal_pos[0], self.goal_pos[1]] G grid[self.agent_pos[0], self.agent_pos[1]] A for row in grid: print( .join(row)) print(---)3.2 实现一个随机智能体这是一个最简单的基线智能体它将在每个时间步随机选择动作。# random_exploration_agent.py import numpy as np class RandomExplorationAgent: 随机探索智能体作为基线。 def __init__(self, action_space): self.action_space action_space def act(self, observation, deterministicFalse): # 忽略 observation 和 deterministic 参数始终随机选择 return self.action_space.sample() def learn(self, *args, **kwargs): 随机智能体不学习。 pass3.3 编写 TRACES 评估循环评估脚本需要按照 TRACES 的规范运行多个回合episodes并收集关键指标。# run_traces_evaluation.py import gymnasium as gym from custom_exploration_env import SparseRewardMaze from random_exploration_agent import RandomExplorationAgent import numpy as np from collections import defaultdict def evaluate_agent(env, agent, num_episodes100): 在指定环境中评估智能体返回 TRACES 核心指标。 metrics defaultdict(list) for episode in range(num_episodes): obs, info env.reset() terminated False truncated False total_reward 0 steps 0 visited_states set() # 用于计算探索覆盖率 visited_states.add(tuple(obs)) while not (terminated or truncated): action agent.act(obs) next_obs, reward, terminated, truncated, info env.step(action) total_reward reward steps 1 visited_states.add(tuple(next_obs)) obs next_obs # 记录本回合指标 metrics[episode_reward].append(total_reward) metrics[episode_length].append(steps) metrics[success].append(1 if total_reward 0 else 0) # 是否找到目标 metrics[exploration_coverage].append(len(visited_states) / (env.size * env.size)) # 计算汇总统计 summary {} summary[mean_success_rate] np.mean(metrics[success]) summary[mean_episode_length] np.mean(metrics[episode_length]) summary[mean_exploration_coverage] np.mean(metrics[exploration_coverage]) summary[std_episode_reward] np.std(metrics[episode_reward]) # 探索效率平均每步覆盖的新状态数理想情况下早期应较高 coverage_per_step [c / l for c, l in zip(metrics[exploration_coverage], metrics[episode_length])] summary[mean_coverage_per_step] np.mean(coverage_per_step) return summary, metrics if __name__ __main__: # 创建环境 env SparseRewardMaze(size5, max_steps50) # 创建智能体 agent RandomExplorationAgent(env.action_space) # 运行评估 summary, detailed_metrics evaluate_agent(env, agent, num_episodes200) print(“ TRACES 评估结果随机智能体 ”) for key, value in summary.items(): print(f“{key}: {value:.4f}”) # 输出详细结果示例 print(f“\n成功回合数: {sum(detailed_metrics[success])} / 200”)3.4 运行与结果分析执行上述评估脚本python run_traces_evaluation.py预期会看到类似以下的输出 TRACES 评估结果随机智能体 mean_success_rate: 0.0350 mean_episode_length: 50.0000 mean_exploration_coverage: 0.2543 std_episode_reward: 0.1868 mean_coverage_per_step: 0.0051 成功回合数: 7 / 200结果解读成功率mean_success_rate仅 3.5%。在 5x5 的网格中随机行走在 50 步内找到目标的概率很低这符合预期。平均回合长度mean_episode_length50。因为最大步数限制是 50且随机智能体几乎无法提前找到目标所以大部分回合都走到了最大步数。平均探索覆盖率mean_exploration_coverage25.43%。随机探索覆盖了大约四分之一的网格状态。平均每步覆盖率mean_coverage_per_step0.0051。非常低说明随机探索效率低下很多步是在重复访问已探索区域。这个基线结果为我们后续评估更高级的探索算法如基于好奇心的智能体提供了对比基准。4. 探索式 AI 的核心评估指标与 TRACES 的实现TRACES 的价值在于其定义了一套多维度的评估指标体系。以下是关键指标及其在代码中的计算逻辑。4.1 成功率与任务完成度这是最直接的指标但 TRACES 可能对其有更精细的定义。def compute_success_rate(trajectories): 计算成功率。对于多阶段任务可能定义子任务成功率。 successes [1 if traj[rewards][-1] 0 else 0 for traj in trajectories] # 假设最后一步有正奖励表示成功 return np.mean(successes)4.2 样本效率与探索步数衡量智能体需要多少交互步数才能学会任务或达成目标。def compute_sample_efficiency(trajectories, success_threshold0.9): 计算达到特定成功率所需的平均训练步数来自训练历史。 # 假设 trajectories 包含训练历史 # 此函数需要访问训练过程中的检查点数据 pass def compute_episode_length(trajectories): 计算每个成功回合的平均步数。步数越少效率越高。 lengths [len(traj[actions]) for traj in trajectories if traj[success]] return np.mean(lengths) if lengths else None4.3 探索覆盖率与状态熵衡量智能体对状态空间的探索充分程度。def compute_coverage(visited_states_list, total_state_space_size): 计算访问过的唯一状态占总状态空间的比例。 all_visited set() for visited in visited_states_list: all_visited.update(visited) return len(all_visited) / total_state_space_size def compute_state_entropy(visited_state_counts): 基于访问频率计算状态分布的熵衡量探索的均匀性。 probs np.array(list(visited_state_counts.values())) / sum(visited_state_counts.values()) entropy -np.sum(probs * np.log(probs 1e-10)) return entropy4.4 好奇心与内在奖励对于使用内在好奇心模块ICM的智能体需要评估其好奇心驱动的有效性。def analyze_intrinsic_reward(trajectories): 分析内在奖励与外在奖励的关系以及内在奖励随时间的变化。 intrinsic_rewards [] extrinsic_rewards [] for traj in trajectories: intrinsic_rewards.extend(traj[intrinsic_rewards]) extrinsic_rewards.extend(traj[extrinsic_rewards]) # 计算相关性、峰值、衰减情况等 correlation np.corrcoef(intrinsic_rewards, extrinsic_rewards)[0,1] return {intrinsic_extrinsic_correlation: correlation}4.5 泛化能力在 TRACES 中泛化能力可能通过在训练中未见过的环境变体如不同的迷宫布局、物体属性上测试来衡量。def evaluate_generalization(agent, train_env_suite, test_env_suite): 分别在训练环境族和测试环境族上评估智能体性能。 train_score evaluate_on_suite(agent, train_env_suite) test_score evaluate_on_suite(agent, test_env_suite) generalization_gap train_score - test_score # 差距越小泛化越好 return {train_score: train_score, test_score: test_score, generalization_gap: generalization_gap}4.6 指标汇总与可视化TRACES 评估最终应生成一份综合报告。def generate_traces_report(metrics_dict, agent_name, env_name): 生成格式化的评估报告。 report f“TRACES Evaluation Report\n” report f“\n” report f“Agent: {agent_name}\n” report f“Environment: {env_name}\n” report f“\nKey Metrics:\n” for metric_name, value in metrics_dict.items(): if isinstance(value, float): report f“ {metric_name}: {value:.4f}\n” else: report f“ {metric_name}: {value}\n” # 可以添加可视化代码如绘制成功率曲线、探索覆盖率热图等 # import matplotlib.pyplot as plt # ... return report5. 构建一个基于好奇心的探索智能体进行对比为了展示 TRACES 如何区分不同探索策略我们实现一个简单的基于“计数”的探索智能体。它倾向于访问访问次数少的状态。5.1 实现计数探索智能体# counting_exploration_agent.py import numpy as np from collections import defaultdict class CountingExplorationAgent: 一个简单的基于访问计数的探索智能体。 def __init__(self, action_space, exploration_bonus_weight0.1): self.action_space action_space self.exploration_bonus_weight exploration_bonus_weight self.state_counts defaultdict(int) # 状态访问计数器 self.state_action_counts defaultdict(lambda: defaultdict(int)) # 状态-动作对访问计数器 def _get_state_key(self, observation): 将观察转换为可哈希的键用于计数。 return tuple(observation.flatten()) if isinstance(observation, np.ndarray) else observation def act(self, observation, deterministicFalse): state_key self._get_state_key(observation) # 计算每个动作的“探索价值” action_values [] for a in range(self.action_space.n): # 基础假设所有动作的外部奖励期望为0稀疏奖励环境 intrinsic_bonus self.exploration_bonus_weight / (np.sqrt(self.state_action_counts[state_key][a]) 1) action_values.append(intrinsic_bonus) # 选择探索价值最高的动作 chosen_action np.argmax(action_values) return chosen_action def update_counts(self, observation, action): 更新访问计数。在实际RL算法中这通常在经验回放后进行。 state_key self._get_state_key(observation) self.state_counts[state_key] 1 self.state_action_counts[state_key][action] 1 def learn(self, *args, **kwargs): 这个简单版本不进行价值函数学习仅更新计数。 pass5.2 修改评估循环以支持计数智能体# 在 evaluate_agent 函数中为 CountingExplorationAgent 添加计数更新 def evaluate_agent_with_counts(env, agent, num_episodes100): metrics defaultdict(list) for episode in range(num_episodes): obs, info env.reset() terminated False truncated False total_reward 0 steps 0 visited_states set() visited_states.add(tuple(obs)) while not (terminated or truncated): action agent.act(obs) next_obs, reward, terminated, truncated, info env.step(action) # 如果是计数智能体更新计数 if hasattr(agent, update_counts): agent.update_counts(obs, action) total_reward reward steps 1 visited_states.add(tuple(next_obs)) obs next_obs metrics[episode_reward].append(total_reward) metrics[episode_length].append(steps) metrics[success].append(1 if total_reward 0 else 0) metrics[exploration_coverage].append(len(visited_states) / (env.size * env.size)) # ... 后续汇总统计与之前相同 return summary, metrics5.3 运行对比实验# compare_agents.py from custom_exploration_env import SparseRewardMaze from random_exploration_agent import RandomExplorationAgent from counting_exploration_agent import CountingExplorationAgent from run_traces_evaluation import evaluate_agent_with_counts import pandas as pd env SparseRewardMaze(size5, max_steps50) num_episodes 200 print(“评估随机智能体...”) random_agent RandomExplorationAgent(env.action_space) random_summary, _ evaluate_agent_with_counts(env, random_agent, num_episodes) print(“\n评估计数探索智能体...”) counting_agent CountingExplorationAgent(env.action_space, exploration_bonus_weight0.5) counting_summary, _ evaluate_agent_with_counts(env, counting_agent, num_episodes) # 对比结果 results_df pd.DataFrame([random_summary, counting_summary], index[‘Random’, ‘Counting’]) print(“\n 智能体性能对比 ) print(results_df)预期对比结果 计数探索智能体在exploration_coverage和mean_coverage_per_step上应该显著高于随机智能体并且success_rate也可能有提升。这直观地展示了主动探索策略的有效性而 TRACES 的指标量化了这种提升。6. 常见问题与排查指南在使用 TRACES 或开发探索式 AI 时你会遇到一些典型问题。6.1 环境集成问题问题现象可能原因检查方式处理建议ModuleNotFoundError: No module named tracesTRACES 包未正确安装或不在 Python 路径中。在 Python 中运行import sys; print(sys.path)和 pip listgrep traces。gymnasium.error.UnregisteredEnv自定义环境未在 Gymnasium 中注册。确认环境注册代码gym.register(id...)是否被执行。在评估脚本开头调用环境注册函数或确保make_env函数能正确创建环境。环境重置后状态不一致reset方法没有正确初始化所有变量或使用了随机种子但未处理。在reset方法开始处调用super().reset(seedseed)并固定self.np_random。确保reset返回的初始状态是确定性的当提供 seed 时并清理上一回合的历史数据。6.2 评估指标异常问题现象可能原因检查方式处理建议成功率始终为 0任务难度过高智能体策略完全无效或奖励函数定义有误。1. 用人工策略如硬编码测试环境是否可解。2. 打印每一步的奖励检查正奖励是否被触发。1. 先验证环境本身。2. 考虑设计更简单的课程学习任务。3. 检查智能体是否接收到了正确的观察。探索覆盖率极低智能体被困于局部区域或状态表示过于复杂导致“重复访问”判断失效。1. 可视化智能体的运动轨迹。2. 检查visited_states中状态键的计算方式确保相同状态能正确归并。1. 增加探索激励权重。2. 简化状态表示如使用网格坐标而非原始像素。3. 引入随机动作噪声。评估结果波动巨大评估回合数太少或环境/智能体随机性太强。计算指标的标准差并增加num_episodes。增加评估回合数如从 100 增加到 1000并使用不同的随机种子运行多次评估取平均。6.3 智能体训练不稳定问题现象可能原因检查方式处理建议训练后期性能突然崩溃常见于基于价值的算法由于过估计或探索策略过于激进。绘制训练曲线查看崩溃是否与学习率更新、探索率衰减或目标网络更新同步发生。1. 调小学习率。2. 使用更保守的探索衰减计划。3. 采用 Double DQN、Dueling DQN 等稳定化技术。内在奖励消失或爆炸内在奖励预测器如 ICM 中的逆模型训练不当。监控内在奖励值的范围检查预测器的损失是否收敛。1. 对内在奖励进行归一化或裁剪。2. 调整内在奖励的权重系数。3. 确保预测器网络结构适合任务。6.4 性能与效率问题问题现象可能原因检查方式处理建议评估速度非常慢环境模拟本身很耗时或状态/奖励计算复杂。使用性能分析工具如cProfile或line_profiler定位瓶颈。1. 对环境进行简化或使用更快的模拟器。2. 将状态预处理移至环境外部。3. 考虑使用向量化环境并行评估。内存占用过高存储了完整的轨迹历史用于评估或智能体回放缓冲区过大。监控内存使用如memory_profiler检查哪些对象占用了大量空间。1. 评估时只记录必要指标而非完整观察序列。2. 限制回放缓冲区大小。3. 使用生成器而非列表存储大型数据。7. 探索式 AI 开发的最佳实践与扩展方向基于 TRACES 的评估理念以下是一些开发高效探索式 AI 的建议。7.1 智能体设计最佳实践从简单基线开始永远先运行一个随机智能体或简单启发式智能体以建立性能底线并验证环境。分离探索与利用策略在算法设计上明确区分探索组件如好奇心模块、计数模型、随机网络蒸馏和利用组件如策略网络、价值函数。这有助于调试和分析。内在奖励的归一化内在奖励的量级可能与外部奖励差异巨大。动态地归一化内在奖励如使用运行统计量可以稳定训练。使用课程学习从简化版本的任务开始训练逐步增加难度可以引导智能体学习有效的探索策略。集成多个探索策略不要只依赖一种探索机制。可以结合计数探索、好奇心驱动探索ICM、基于不确定性的探索Bootstrapped DQN等。7.2 评估与实验管理最佳实践固定随机种子在训练和评估开始时固定所有随机数生成器Python, NumPy, PyTorch/TensorFlow, 环境的种子以确保结果可复现。进行多次独立运行由于强化学习的高随机性任何实验都应进行多次如5-10次不同种子的运行报告平均性能和标准差。记录完整的配置使用配置文件如 YAML记录所有超参数、环境设置、网络结构并将此配置与实验结果日志、模型、评估指标关联存储。可视化探索过程定期渲染环境或绘制智能体访问状态的热力图直观理解其探索行为。在 TRACES 的多个任务上测试一个优秀的探索算法应在 TRACES 包含的多个不同性质的任务上表现良好而不仅仅是过拟合某一个环境。7.3 扩展方向超越基础探索TRACES 基准鼓励研究更高级的探索能力分层探索让智能体学会抽象动作宏动作或子目标在更高层次上进行规划探索。基于模型的探索让智能体学习环境的动力学模型并在模型中进行“想象”探索减少真实环境交互成本。社会探索在多智能体环境中智能体可以通过观察其他智能体的行为来加速探索。元探索让智能体学会如何探索即学习一个适用于新任务的探索策略。将探索能力与大规模语言模型结合利用 LLM 的先验知识来指导探索过程例如生成有希望探索的子目标或解释环境反馈。要深入研究这些方向可以在 TRACES 提供的标准环境上实现上述高级算法并利用其多维指标进行严谨的对比分析从而推动探索式 AI 向更通用、更高效的方向发展。