探索性扩散模型

方法概览图,展示探索性策略模型从理论动机、无奖励预训练到微调的流程。

科学方法概览图,采用克制的矢量风格,包含三维策略空间图、预训练经验回放缓冲区和微调面板。
使用此提示词开始

方法概览图,展示探索性策略模型从理论动机、无奖励预训练到微调的流程。

体验 Kimi Design
为机器学习方法章节开篇制作一张由科学可视化设计师设计的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容保持匿名,仅限一般学术概念和符号,不标注归属。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。按顺序呈现三个连续部分,标记为 (a)、(b) 和 (c),并配有清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行域、由实线连接的绿色策略点,以及一个红色目标点。用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。使用粗红色箭头连接 (a) 和 (b)。将 (b) 和 (c) 包在标题为“探索性扩散模型”的蓝色圆角虚线边框内;(b) 的标题为“预训练”。包含一个圆角经验回放缓冲区,内部横向排列一行轨迹缩略图;同时配有红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接各图标;让环境回连至缓冲区,并标注交互、行为收集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色改进箭头。保留 π_g 和 π_d 及其策略名称;为相关图标、箭头和曲线添加直接的语义标签。

使用白色底色,搭配克制的深蓝、红、绿强调色,以及浅灰和淡米色填充。采用细而精确的线条和克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和归属信息仅限科学内容。
中性色边框

将 (b) 和 (c) 周围的虚线边框从蓝色改为灰色,其他部分保持不变。

体验 Kimi Design
为机器学习方法章节开篇制作一张由科学可视化设计师设计的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容保持匿名,仅限一般学术概念和符号,不标注归属。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。按顺序呈现三个连续部分,标记为 (a)、(b) 和 (c),并配有清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行域、由实线连接的绿色策略点,以及一个红色目标点。用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。使用粗红色箭头连接 (a) 和 (b)。将 (b) 和 (c) 包在一个蓝色圆角虚线边框内,标题为“探索性扩散模型”;(b) 的标题为“预训练”。包含一个圆角经验回放缓冲区,内部横向排列一行轨迹缩略图;同时配有红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接各图标;让环境回连至缓冲区,并标注交互、行为收集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色改进箭头。保留 π_g 和 π_d 及其策略名称;为相关图标、箭头和曲线添加直接的语义标签。

使用白色底色,搭配克制的深蓝、红、绿强调色,以及浅灰和淡米色填充。采用细而精确的线条和克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和归属信息仅限科学内容。
添加第二个目标点

策略空间中显示两个红色目标点,而非一个;图表其余部分不变。

体验 Kimi Design
为机器学习方法章节开篇制作一张由科学可视化设计师设计的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容保持匿名,仅限一般学术概念和符号,不标注归属。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。按顺序呈现三个连续部分,标记为 (a)、(b) 和 (c),并配有清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行域、由实线连接的绿色策略点,以及一个红色目标点。用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。使用粗红色箭头连接 (a) 和 (b)。将 (b) 和 (c) 包在标题为“探索性扩散模型”的蓝色圆角虚线边框内;(b) 的标题为“预训练”。包含一个圆角经验回放缓冲区,内部横向排列一行轨迹缩略图;同时配有红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接各图标;让环境回连至缓冲区,并标注交互、行为收集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色改进箭头。保留 π_g 和 π_d 及其策略名称;为相关图标、箭头和曲线添加直接的语义标签。

使用白色底色,搭配克制的深蓝、红、绿强调色,以及浅灰和淡米色填充。采用细而精确的线条和克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和归属信息仅限科学内容。
修改模型框标题

将虚线框名称从“探索性扩散模型”改为“探索性策略模型”,其余部分不变。

体验 Kimi Design
为机器学习方法章节开篇制作一张由科学可视化设计师设计的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容保持匿名,仅限一般学术概念和符号,不标注归属。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。按顺序呈现三个连续部分,标记为 (a)、(b) 和 (c),并配有清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行域、由实线连接的绿色策略点,以及一个红色目标点。用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。使用粗红色箭头连接 (a) 和 (b)。将 (b) 和 (c) 包在蓝色圆角虚线边框内,标题为“探索性扩散模型”;(b) 的标题为“预训练”。包含一个圆角经验回放缓冲区,内部横向排列一行轨迹缩略图;同时配有红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接各图标;让环境回连至缓冲区,并标注交互、行为收集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色改进箭头。保留 π_g 和 π_d 及其策略名称;为相关图标、箭头和曲线添加直接的语义标签。

使用白色底色,搭配克制的深蓝、红、绿强调色,以及浅灰和淡米色填充。采用细而精确的线条和克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和归属信息仅限科学内容。