ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

22、构建多智能体环境:从对抗到个性化奖励

22、构建多智能体环境:从对抗到个性化奖励

构建多智能体环境:从对抗到个性化奖励

1. 对抗性自我博弈

在多智能体训练中,对抗性自我博弈是一种强大的方法。以 ML - Agents 的 Banana 环境为例,该环境中有多个智能体在场景中随机游走并收集香蕉,同时智能体还配备了激光指针,可使被击中的对手在数秒内失去行动能力。

操作步骤如下:
1. 从Assets | ML - Agents | Examples | BananaCollectors | Scenes文件夹中打开 Banana 场景。
2. 选择并禁用额外的训练区域RLArea(1)RLArea(3)
3. 选择RLArea中的五个智能体(Agent,Agent(1),Agent(2),Agent(3),Agent(4))。
4. 将Banana Agent | BrainBananaPlayer切换到BananaLearning
5. 选择Academy并将Banana Academy | Brains | Control属性设置为Enabled
6. 在编辑器中选择Banana Agent

返回列表