本文还有配套的精品资源,点击获取 menu-r.4af5f7ec.gif

简介:Q学习是一种基于强化学习的算法,通过构建Q表来学习在不同状态下采取何种动作以最大化长期累积奖励。其核心更新规则基于贝尔曼最优方程,在MATLAB中可通过定义状态空间、动作空间、奖励函数和状态转移机制进行建模与仿真。结合ε-greedy策略实现探索与利用的平衡,并可通过引入经验回放和深度Q网络(DQN)提升性能。本项目包含完整的MATLAB代码示例,适用于游戏控制、机器人路径规划等场景,帮助学习者掌握Q学习的基本原理与实际应用方法。
Q学习,matlab

1. Q学习基本原理与强化学习框架

强化学习范式与Q学习定位

强化学习(Reinforcement Learning, RL)通过智能体与环境的持续交互,以试错方式学习最优决策策略。其核心要素包括状态(State)、动作(Action)、奖励(Reward)、策略(Policy)和价值函数(Value Function)。在马尔可夫决策过程(MDP)的数学框架下,系统状态具有马尔可夫性,即下一状态仅依赖当前状态与动作。

Q学习作为无模型(model-free)时序差分(TD)控制算法,直接学习动作价值函数 $ Q(s,a) $,表示在状态 $ s $ 下执行动作 $ a $ 后所能获得的期望累积回报。其更新规则基于贝尔曼最优方程:

Q(s,a) \leftarrow Q(s,a) + \alpha \left[ r + \gamma \max_{a’} Q(s’,a’) - Q(s,a) \right]

其中,$\alpha$ 为学习率,$\gamma$ 为折扣因子。该公式体现了Q学习的离线可更新特性,无需环境模型即可通过经验样本逐步逼近最优策略。

MATLAB在强化学习实现中的优势

MATLAB凭借其强大的矩阵运算能力、内置优化函数库及直观的可视化工具(如 plot , imagesc , animate 等),为Q学习算法提供了高效的开发平台。其脚本化编程支持快速原型设计,而Simulink可无缝集成复杂动态系统仿真,适用于控制工程与机器人等应用场景。

此外,MATLAB的结构体与元胞数组灵活支持多维Q表构建, function handle 机制便于封装环境动力学与策略逻辑,为后续章节的模块化实现奠定基础。

2. Q表设计与初始化实现

在强化学习的实践中,Q表(Q-table)是Q学习算法的核心数据结构,用于存储每个状态-动作对所对应的动作价值函数估计值。其设计直接影响智能体的学习效率、收敛速度以及最终策略的质量。一个良好的Q表不仅需要准确映射状态与动作之间的关系,还需具备高效的访问机制和合理的初始化策略,以支持后续的贝尔曼方程迭代更新。本章将深入剖析Q表的数据结构本质,探讨其在MATLAB环境下的多种实现方式,并详细讲解如何通过编程手段完成Q表的初始化、更新逻辑及主训练流程控制,为构建完整Q学习系统奠定坚实基础。

2.1 Q表的数据结构与数学表达

Q表本质上是一个从状态空间 $ \mathcal{S} $ 和动作空间 $ \mathcal{A} $ 到实数集 $ \mathbb{R} $ 的映射,形式化表示为:

Q: \mathcal{S} \times \mathcal{A} \rightarrow \mathbb{R}

其中,$ Q(s, a) $ 表示在状态 $ s $ 下执行动作 $ a $ 所能获得的期望累积回报。该值随着智能体不断与环境交互而逐步被修正,目标是逼近最优动作价值函数 $ Q^*(s, a) $。由于Q学习是一种基于表格的方法(tabular method),它要求状态和动作均离散化,以便能够用有限维数组或查找表来存储所有可能的状态-动作组合的价值估计。

2.1.1 Q表的定义及其在状态-动作空间中的映射关系

在一个典型的离散决策问题中,假设状态总数为 $ |\mathcal{S}| = N $,动作总数为 $ |\mathcal{A}| = M $,则Q表可视为一个 $ N \times M $ 的二维矩阵,每一行对应一个状态索引,每一列对应一个动作编号。例如,在4×4网格世界环境中,共有16个状态(编号0~15),每个状态下允许上下左右四个动作,则Q表大小为 $ 16 \times 4 $。

这种结构使得状态-动作对可以通过整数索引快速定位,极大提升了查表和更新操作的效率。更重要的是,这种显式存储方式避免了函数逼近带来的偏差,保证了在满足一定条件下Q学习的收敛性。

为了建立从实际状态描述到Q表索引的映射,通常引入 状态编码器 (state encoder)。例如,二维坐标 $ (x, y) $ 可通过线性映射转换为一维索引:
\text{index} = x + y \cdot W
其中 $ W $ 为地图宽度。类似地,动作也可以采用枚举编码,如:0=上,1=下,2=左,3=右。

下表展示了某简单任务中部分状态-动作对的Q值初始配置示例:

状态 (s) 动作 (a=0:上) 动作 (a=1:下) 动作 (a=2:左) 动作 (a=3:右)
0 0.0 0.0 0.0 0.5
1 0.0 0.0 0.3 0.7
2 0.0 0.0 0.6 0.8

该表体现了Q值作为“偏好评分”的作用——数值越高,说明该动作在当前状态下越值得选择。

此外,状态-动作映射的过程可通过如下mermaid流程图清晰展示:

graph TD
    A[原始状态输入] --> B{是否已离散化?}
    B -- 是 --> C[生成状态索引]
    B -- 否 --> D[进行分箱/编码处理]
    D --> C
    C --> E[结合动作编号]
    E --> F[访问Q(s,a)]
    F --> G[返回Q值用于决策或更新]

此流程强调了从感知输入到Q表查询之间的完整路径,尤其适用于状态需预处理的任务场景。

2.1.2 基于矩阵与哈希表的Q表实现方式比较

在具体实现中,Q表可以采用不同的底层数据结构,主要分为两类: 矩阵型实现 哈希表型实现 。两者各有优劣,适用场景不同。

(1)矩阵型Q表(Matrix-based Q-table)

适用于状态和动作均为有限且可枚举的情况。在MATLAB中,使用 double 类型的二维数组即可高效实现:

% 初始化Q表:N_states × N_actions
N_states = 16;
N_actions = 4;
Q_table = zeros(N_states, N_actions);

优点包括:
- 访问速度快(O(1)时间复杂度)
- 支持向量化运算
- 易于调试和可视化

但缺点也明显:
- 内存消耗大,尤其当状态空间呈指数增长时(维度灾难)
- 不适用于无法预先枚举的状态集合

(2)哈希表型Q表(Hash-based Q-table)

利用键值对结构动态存储Q值,适合稀疏或不可预知的状态空间。在MATLAB中可通过 containers.Map dictionary 类实现:

% 使用containers.Map创建哈希Q表
Q_hash = containers.Map();

% 存储Q值:键为[s, a]元组字符串,值为Q(s,a)
key = sprintf('s%d_a%d', state, action);
if ~isKey(Q_hash, key)
    Q_hash(key) = 0;  % 初始化
end

优势在于:
- 内存按需分配,节省资源
- 支持任意类型的状态表示(如字符串、结构体等)
- 更灵活,便于扩展至部分可观测环境

劣势则是:
- 查找开销高于数组(依赖哈希函数性能)
- 难以批量操作和绘图分析
- 序列化和保存较复杂

下面对比两种实现方式的关键特性:

特性 矩阵型Q表 哈希表型Q表
时间复杂度(访问) O(1) 平均O(1),最坏O(n)
空间复杂度 O( S
初始化难易度 简单(zeros/rand等) 需动态插入
是否支持未见状态
MATLAB兼容性 极佳 良好(Map类稳定)
适用场景 小规模离散MDP 大状态空间、稀疏探索

综上所述,在大多数教学和中小型仿真任务中,推荐优先使用矩阵型Q表;而在涉及高维输入或连续状态离散化后仍庞大的系统中,应考虑结合哈希机制或过渡到函数逼近方法(如DQN)。

2.2 MATLAB中Q表的初始化方法

Q表的初始化虽看似简单,却深刻影响着学习初期的行为策略和探索效率。不当的初始化可能导致局部最优陷阱或长时间低效探索。MATLAB提供了丰富的数组构造工具,支持多种初始化策略的便捷实现。

2.2.1 全零初始化与随机初始化策略分析

最常见的两种初始化方式为 全零初始化 小范围随机初始化

全零初始化

即令所有Q值初始为0:

Q_table = zeros(numStates, numActions);

这种方式的优点是:
- 符合“无先验知识”假设
- 探索完全由ε-greedy机制驱动
- 收敛理论上有保障

但在实践中存在一个问题:当所有动作价值相同时,argmax操作会随机选择动作,导致早期行为完全随机,学习曲线起步缓慢。

随机初始化

赋予Q值一个小的随机扰动,常用均匀分布或正态分布:

% 方法一:均匀分布 [-0.1, 0.1]
Q_table = 0.2 * (rand(numStates, numActions) - 0.5);

% 方法二:正态分布 N(0, 0.1)
Q_table = 0.1 * randn(numStates, numActions);

这种方法引入了 乐观初始值 (optimistic initialization)的思想——让每个动作看起来都有潜在高回报,从而激励智能体主动尝试所有动作,实现自然探索(intrinsic exploration)。这在某些任务中能显著加快学习速度。

然而,过度乐观可能导致后期难以修正错误估计,因此需谨慎设置初始方差。

下图用mermaid绘制了不同初始化策略对探索行为的影响机制:

graph LR
    Start[开始训练] --> Init{Q表初始化方式}
    Init --> Zero[全零初始化]
    Init --> Random[随机初始化]
    Zero --> Policy[ε-greedy主导探索]
    Random --> Optimism[乐观值诱导探索]
    Policy --> Trial[试错次数多,学习慢]
    Optimism --> FastStart[早期探索充分,收敛快]
    Trial & FastStart --> Converge[趋于Q*]

由此可见,初始化不仅是技术细节,更是探索策略的一部分。

2.2.2 利用MATLAB数组与元胞数组构建多维Q表

对于更复杂的任务,状态可能由多个变量构成(如位置、速度、方向等),此时直接使用二维Q表不再适用。MATLAB提供灵活的多维数组和元胞数组(cell array)来应对此类情况。

多维数组实现(适用于规则离散化)

若各维度均已量化为整数索引,可用高维数组存储Q值:

% 示例:三维状态空间 + 四个动作
dim1_bins = 10;  % 如X坐标分10箱
dim2_bins = 8;   % Y坐标
dim3_bins = 5;   % 方向角
numActs = 4;

Q_md = zeros(dim1_bins, dim2_bins, dim3_bins, numActs);

访问某个状态下的Q值:

q_vals = Q_md(x_idx, y_idx, dir_idx, :);  % 返回该状态所有动作Q值
best_action = find(q_vals == max(q_vals), 1);

这种方式内存占用较大,但访问极快,适合嵌入式部署前的原型验证。

元胞数组实现(适用于非齐次状态)

当各状态维度取值不统一或包含不同类型数据时,可使用元胞数组存储键值对:

% 创建空元胞数组:每行存储 {state_vector, Q_values}
Q_cell = cell(0, 2);

% 添加新状态条目
new_state = [3, 7, 2];  % 当前状态向量
q_row = [0.1, -0.2, 0.5, 0.3];
Q_cell{end+1, 1} = new_state;
Q_cell{end+1, 2} = q_row;

查找过程需遍历匹配:

function q_val = get_Q(Q_cell, s, a)
    for i = 1:size(Q_cell, 1)
        if isequal(Q_cell{i,1}, s)
            q_val = Q_cell{i,2}(a);
            return;
        end
    end
    q_val = 0;  % 默认值
end

尽管效率较低,但灵活性极高,可用于研究阶段的状态泛化实验。

2.3 Q表更新机制的编程实现

Q学习的核心在于通过贝尔曼方程不断迭代更新Q值,使其逐渐逼近最优价值函数。

2.3.1 基于贝尔曼方程的Q值迭代公式编码

Q学习的更新规则如下:

Q(s_t, a_t) \leftarrow Q(s_t, a_t) + \alpha \left[ r_{t+1} + \gamma \max_a Q(s_{t+1}, a) - Q(s_t, a_t) \right]

其中:
- $ \alpha \in (0,1] $:学习率,控制新信息的权重
- $ \gamma \in [0,1] $:折扣因子,决定远期奖励的重要性
- $ r_{t+1} $:即时奖励
- $ \max_a Q(s_{t+1}, a) $:下一状态的最大Q值

在MATLAB中实现该更新:

% 参数设定
alpha = 0.1;    % 学习率
gamma = 0.95;   % 折扣因子

% 单步Q值更新
reward = env_step(current_state, action);        % 执行动作获取奖励
next_state = get_current_state();               % 获取下一状态
next_max_q = max(Q_table(next_state, :));       % 贝尔曼目标中的max Q

% Q值更新公式
td_error = reward + gamma * next_max_q - Q_table(current_state, action);
Q_table(current_state, action) = Q_table(current_state, action) + alpha * td_error;
代码逐行解析:
  1. alpha = 0.1; :设置学习率为0.1,表示每次仅吸收新误差的10%,防止震荡。
  2. gamma = 0.95; :较高的折扣因子鼓励长期规划。
  3. reward = env_step(...) :调用环境函数执行动作并返回标量奖励。
  4. next_state = ... :获取环境反馈的新状态。
  5. next_max_q = max(...) :关键步骤,选取下一状态中最大Q值,体现“贪婪”原则。
  6. td_error = ... :计算时序差分误差(Temporal Difference Error),反映预测与现实的差距。
  7. Q_table(...) = ... :应用梯度上升思想更新Q值。

注意:此处未包含探索机制(如ε-greedy),将在第四章详述。

2.3.2 使用循环结构完成单步Q值更新操作

完整的Q值更新需嵌入训练循环中,以下为简化示例:

for episode = 1:numEpisodes
    state = reset_environment();
    while ~is_terminal(state)
        % ε-greedy选择动作(暂略)
        action = choose_action(Q_table, state, epsilon);
        % 执行动作
        reward = step_environment(action);
        next_state = get_state();
        % Q值更新
        td_target = reward + gamma * max(Q_table(next_state, :));
        td_error = td_target - Q_table(state, action);
        Q_table(state, action) = Q_table(state, action) + alpha * td_error;
        % 状态转移
        state = next_state;
    end
end

该循环实现了“感知-决策-执行-学习”的闭环流程,是Q学习的标准骨架。

2.4 Q学习主循环流程控制

2.4.1 MATLAB中while与for循环在训练迭代中的应用

训练过程通常由外层 for 循环控制回合数,内层 while 循环处理单个回合的步进:

max_episodes = 1000;
max_steps_per_episode = 200;

for ep = 1:max_episodes
    state = init_state;
    total_reward = 0;
    for t = 1:max_steps_per_episode
        if is_terminal(state)
            break;
        end
        action = select_action_greedy(Q_table(state,:), epsilon);
        [next_state, reward, done] = env_step(state, action);
        % Q更新
        Q_table(state, action) = Q_table(state, action) + ...
            alpha * (reward + gamma * max(Q_table(next_state,:)) - Q_table(state,action));
        total_reward = total_reward + reward;
        state = next_state;
    end
    % 记录回报
    rewards(ep) = total_reward;
end

for 适用于固定迭代次数的统计实验, while 更适合不确定长度的序列任务。

2.4.2 终止条件设置与最大迭代次数管理

合理终止条件包括:
- 达到最大回合数
- 连续若干回合平均回报超过阈值
- Q值变化小于容差(收敛检测)

convergence_threshold = 1e-4;
prev_avg_reward = 0;

for ep = 1:max_episodes
    % ...训练过程...
    avg_recent = mean(rewards(max(1,ep-10):ep));
    if abs(avg_recent - prev_avg_reward) < convergence_threshold && ep > 50
        fprintf('Converged at episode %d\n', ep);
        break;
    end
    prev_avg_reward = avg_recent;
end

该机制有效防止无效训练,提升算法实用性。

3. 状态空间与动作空间建模

在强化学习系统中,智能体通过感知环境的状态(State)并执行动作(Action)来影响环境的演化。因此,状态空间与动作空间的设计是构建高效Q学习系统的基础环节。一个合理的建模方式不仅决定了智能体能否准确理解当前环境情境,也直接影响其决策能力和学习效率。尤其在使用表格型Q学习时,由于Q表直接依赖于状态-动作对的离散索引,如何将复杂、连续甚至高维的现实问题映射到可计算的有限集合中,成为算法能否成功落地的关键。

本章将深入探讨状态表示的方法论,分析从原始观测到离散状态编码的技术路径;同时系统阐述动作空间的设计原则,并结合MATLAB平台实现具体的向量化操作和函数封装。最终以经典的“网格世界”任务为例,展示完整状态-动作建模流程,为后续Q值更新和策略优化提供结构化输入支持。

3.1 状态表示与离散化处理

状态是智能体对环境认知的核心载体。在强化学习框架下,理想的状态应满足马尔可夫性质——即当前状态包含所有历史信息中对未来转移和奖励预测必要的内容。然而,在实际应用中,传感器获取的数据往往是连续、高维或噪声干扰严重的。为此,必须设计有效的状态表示机制,将其转化为适合Q学习算法处理的形式。

3.1.1 连续状态的分箱(binning)方法及MATLAB实现

当环境的状态变量为连续值(如小车速度、机器人关节角度等),无法直接作为Q表的索引。此时需采用 状态离散化技术 ,其中最常用的是 分箱法(Binning) 。该方法将连续区间划分为若干个子区间(称为“箱子”或 bins),每个箱子对应一个离散状态编号。

假设某状态变量 $ x \in [x_{\min}, x_{\max}] $,希望划分为 $ N $ 个等宽箱子,则每个箱子的宽度为:

\Delta = \frac{x_{\max} - x_{\min}}{N}

对于任意输入值 $ x $,其对应的离散索引可通过如下公式计算:

\text{index} = \left\lfloor \frac{x - x_{\min}}{\Delta} \right\rfloor

需要注意边界处理:若结果等于 $ N $,通常向下调整至 $ N-1 $,防止数组越界。

在MATLAB中,这一过程可以高效地通过向量化运算完成。以下是一个二维连续状态(如位置和速度)进行联合分箱的示例代码:

% 定义状态范围与分箱数
pos_min = -1.2; pos_max = 0.6; num_pos_bins = 10;
vel_min = -0.07; vel_max = 0.07; num_vel_bins = 10;

% 输入一组连续状态 (n_samples × 2)
states = [0.1, 0.05; -0.8, -0.03; 0.5, 0.06]; % 示例数据

% 计算分箱步长
delta_pos = (pos_max - pos_min) / num_pos_bins;
delta_vel = (vel_max - vel_min) / num_vel_bins;

% 执行分箱(注意clamp防止越界)
pos_idx = floor((states(:,1) - pos_min) / delta_pos);
vel_idx = floor((states(:,2) - vel_min) / delta_vel);

pos_idx = max(min(pos_idx, num_pos_bins - 1), 0);
vel_idx = max(min(vel_idx, num_vel_bins - 1), 0);

% 联合编码为单一整数状态ID
state_ids = pos_idx * num_vel_bins + vel_idx + 1; % +1 for 1-based indexing

disp('离散化后的状态ID:');
disp(state_ids);
逻辑分析与参数说明
  • pos_min , pos_max :定义位置维度的有效范围,超出此范围的值将被截断。
  • num_pos_bins :决定分辨率,过少会导致信息丢失,过多则引发维度爆炸。
  • floor(...) :实现向下取整,确保落入正确的箱内。
  • max(min(...)) :对索引做裁剪,防止因浮点误差导致越界。
  • state_ids = pos_idx * num_vel_bins + vel_idx + 1 :这是典型的 线性索引映射 ,将二维网格展平为一维数组,便于作为Q表的行索引。

⚠️ 注意:MATLAB数组索引从1开始,因此最终加1。若与其他语言交互(如Python),需注意索引起始差异。

该方法适用于低维连续状态空间(一般不超过4维)。随着维度上升,“维度灾难”会迅速增加Q表大小,此时应考虑引入函数逼近或深度学习方法。

此外,还可利用MATLAB内置函数简化操作:

edges_pos = linspace(pos_min, pos_max, num_pos_bins+1);
[~, ~, pos_bin] = histcounts(states(:,1), edges_pos);

这种方式更稳健,能自动处理边缘情况。

3.1.2 状态编码策略:独热编码与索引映射

完成离散化后,还需选择合适的状态编码方式供Q学习模块使用。常见的有两类: 索引映射(Index Mapping) 独热编码(One-Hot Encoding)

编码方式 特点 适用场景
索引映射 每个状态用单个整数表示,内存占用小 表格型Q学习、状态总数可控
独热编码 每个状态表示为长度为 $ N $ 的二进制向量(仅一位为1) 神经网络输入、需保持对称性
嵌入编码 使用查找表将状态映射为稠密向量 DQN等深度方法

在纯表格Q学习中,推荐使用 索引映射 ,因其简洁且易于与Q表行列对应。

下面展示如何在MATLAB中实现多维状态的联合索引映射:

% 多维状态:例如 (方向, 距离, 光照强度),每维分别有不同基数
dims = [4, 3, 5]; % 各维度可能状态数

% 当前状态实例
s = [2, 1, 4]; % 取值应在各维度范围内

% 构建累积乘积基底(类似进位制)
bases = cumprod([1, dims(1:end-1)]); % [1, 4, 12]

% 映射为唯一ID
state_id = sum((s - 1) .* bases) + 1; % MATLAB为1-indexed

disp(['状态 [', num2str(s), '] 映射为 ID: ', num2str(state_id)]);
参数解释与扩展讨论
  • dims :描述每个状态维度的离散水平数量。
  • bases :类似于“权重”,形成一个多维到一维的仿射变换。
  • (s - 1) :将1-based索引转为0-based,适配数学公式。
  • cumprod([1, dims(1:end-1)]) :生成类似“千位、百位、十位”的权值序列。

例如,三维状态 $ (i,j,k) $ 在基数为 $ (d_1,d_2,d_3) $ 下的唯一ID为:
\text{ID} = i\times d_2\times d_3 + j\times d_3 + k
这正是上述代码所实现的。

相比之下, 独热编码 可通过如下方式生成:

total_states = prod(dims);
one_hot = zeros(1, total_states);
one_hot(state_id) = 1;

虽然语义清晰,但当总状态数较大时(如 $ >10^4 $),存储和计算开销显著上升,故不推荐用于传统Q学习。

graph TD
    A[原始观测] --> B{是否连续?}
    B -- 是 --> C[分箱/Binning]
    B -- 否 --> D[枚举状态]
    C --> E[多维离散状态]
    D --> E
    E --> F{编码方式}
    F --> G[索引映射 → Q表索引]
    F --> H[独热编码 → 神经网络输入]
    G --> I[Q Learning 更新]
    H --> J[DQN训练]

上图展示了状态预处理的整体流程。可以看出,状态建模的选择强烈依赖于后续使用的算法类型。对于本章聚焦的表格Q学习,索引映射是最优解。

3.2 动作空间的设计原则

动作空间定义了智能体在每个状态下可采取的行为集合。不同于监督学习中的固定输出类别,强化学习的动作选择具有动态性和策略依赖性。合理设计动作空间不仅能提升探索效率,还能增强策略的可解释性。

3.2.1 有限动作集的枚举与编号规则

在大多数Q学习任务中,动作空间是 有限且离散的 。例如,在自动驾驶中可能是 {左转, 直行, 右转};在机械臂控制中是 {上, 下, 左, 右, 抓取}。

为了便于编程实现,建议对所有动作进行 全局编号 ,建立从整数到具体行为的映射表。这种设计使得Q表的列可以直接对应动作ID。

例如,在MATLAB中可定义如下结构体数组:

actions(1).id = 1;
actions(1).name = 'Up';
actions(1).delta = [-1, 0];

actions(2).id = 2;
actions(2).name = 'Down';
actions(2).delta = [1, 0];

actions(3).id = 3;
actions(3).name = 'Left';
actions(3).delta = [0, -1];

actions(4).id = 4;
actions(4).name = 'Right';
actions(4).delta = [0, 1];

其中 .delta 字段表示该动作在网格坐标系下的位移增量,便于后续状态转移计算。

在Q学习主循环中,只需通过 action_id = argmax(Q(state_id, :)) 获取最优动作,再查表获得实际行为:

[~, best_action_id] = max(Q(state_id, :));
selected_action = actions(best_action_id);
next_state_coord = current_coord + selected_action.delta;

这种设计实现了 策略决策与物理执行的解耦 ,提高了代码的模块化程度。

此外,动作编号应遵循一定顺序(如顺时针、优先级排序),有助于调试和可视化。

3.2.2 多维动作组合的笛卡尔积生成技术

某些复杂任务需要同时控制多个子系统(如机器人的多个关节),此时动作空间呈 多维组合形式 。直接枚举所有组合可能导致动作数指数增长。

解决方法之一是使用 笛卡尔积(Cartesian Product)自动生成全组合

假设两个独立控制轴,每个有3种操作:{-1, 0, 1}(减速、保持、加速),则总共有 $ 3×3=9 $ 种复合动作。

MATLAB中可用 ndgrid 实现:

% 定义各维度动作集
axis1_actions = [-1, 0, 1];
axis2_actions = [-1, 0, 1];

% 生成笛卡尔积
[A1, A2] = ndgrid(axis1_actions, axis2_actions);
all_actions = [A1(:), A2(:)]; % 每行代表一个联合动作

% 添加动作ID
num_actions = size(all_actions, 1);
action_table = struct('id', {}, 'control', {});

for i = 1:num_actions
    action_table(i).id = i;
    action_table(i).control = all_actions(i,:);
end

disp('生成的联合动作表:');
for i = 1:num_actions
    fprintf('ID=%d -> 控制向量=[%.0f, %.0f]\n', ...
        action_table(i).id, action_table(i).control);
end
输出示例:
ID=1 -> 控制向量=[-1, -1]
ID=2 -> 控制向量=[ 0, -1]
ID=3 -> 控制向量=[ 1, -1]

这种方法适用于动作之间相互独立的情况。若存在约束(如不能同时加速和刹车),可在生成后添加过滤逻辑:

valid_mask = ~(all_actions(:,1)==1 & all_actions(:,2)==-1); % 排除矛盾指令
all_actions = all_actions(valid_mask, :);
flowchart LR
    subgraph 动作空间构建
    A[单维动作集] --> B[笛卡尔积生成]
    B --> C[生成全组合]
    C --> D[施加物理约束]
    D --> E[编号并存入动作表]
    end

此流程确保动作空间既全面又符合实际物理限制,避免无效探索。

3.3 环境接口建模

为了实现智能体与环境的交互,必须将环境抽象为标准化接口。这包括状态转移函数、奖励反馈机制和重置逻辑。良好的封装有助于提升代码复用性与测试便利性。

3.3.1 状态转移函数的MATLAB函数封装

状态转移函数 $ T(s’ | s, a) $ 描述在状态 $ s $ 下执行动作 $ a $ 后转移到 $ s’ $ 的概率分布。在确定性环境中,该函数可退化为一个映射关系。

以网格世界为例,定义如下函数:

function next_state = transition_func(current_state, action, grid_size)
% TRANSITION_FUNC 确定性状态转移函数
%
% 输入:
%   current_state: [row, col], 当前坐标
%   action: 包含 .delta 字段的动作结构体
%   grid_size: [rows, cols]
%
% 输出:
%   next_state: 转移后坐标(已处理边界)

    delta = action.delta;
    proposed = current_state + delta;

    % 边界检查:不允许走出地图
    next_state(1) = max(1, min(proposed(1), grid_size(1)));
    next_state(2) = max(1, min(proposed(2), grid_size(2)));

end
参数说明:
  • current_state :当前所在网格坐标,MATLAB中习惯用1-based索引。
  • action.delta :动作引起的坐标变化,如上移为[-1,0]。
  • proposed :提议的新位置,可能越界。
  • max/min 组合实现“撞墙反弹”效果,即触边停止。

调用示例:

s = [2, 3];
a = actions(1); % Up
s_next = transition_func(s, a, [4,4]);
disp(['向上移动后位置: ', num2str(s_next)]);

该函数具备高度通用性,只需更换 actions grid_size 即可用于不同规模的地图。

3.3.2 观测反馈机制与环境重置逻辑实现

完整的环境还应提供观测(Observe)、奖励(Reward)和重置(Reset)功能。这些可通过主控函数统一管理:

function [reward, next_state, is_terminal] = env_step(action_id, current_state, target_state, actions, grid_size)
% ENV_STEP 执行一步环境交互
%
% 返回:
%   reward: 即时奖励
%   next_state: 下一状态坐标
%   is_terminal: 是否到达终止状态

    % 执行状态转移
    a = actions(action_id);
    next_state = transition_func(current_state, a, grid_size);

    % 判断是否到达目标
    if isequal(next_state, target_state)
        reward = 10;
        is_terminal = true;
    else
        reward = -1; % 每步惩罚,鼓励快速完成
        is_terminal = false;
    end

end

function initial_state = env_reset()
    initial_state = [1, 1]; % 固定起点
end

上述设计构成了一个最小可行的环境接口,可供Q学习主循环调用。

函数名 输入 输出 用途
env_step action_id, state reward, next_state, done 单步推进
env_reset initial_state 重置环境

这种模块化设计极大提升了系统的可维护性,也为后续集成更复杂环境(如带障碍物、随机风扰)预留了扩展接口。

3.4 实践案例:网格世界环境的状态-动作建模

3.4.1 定义4×4网格地图的状态编号方案

考虑一个 $ 4×4 $ 的方形网格世界,每个格子作为一个独立状态。总共16个状态,编号从1到16,按行优先顺序排列:

(1,1)=1   (1,2)=2   (1,3)=3   (1,4)=4
(2,1)=5   (2,2)=6   (2,3)=7   (2,4)=8
(3,1)=9   (3,2)=10  (3,3)=11  (3,4)=12
(4,1)=13  (4,2)=14  (4,3)=15  (4,4)=16

转换公式为:
\text{state_id} = (row - 1) \times 4 + col

反向映射:
row = \left\lfloor \frac{state_id - 1}{4} \right\rfloor + 1,\quad col = mod(state_id - 1, 4) + 1

在MATLAB中实现双向映射:

% 正向:坐标→ID
coord_to_id = @(r,c) (r-1)*4 + c;

% 反向:ID→坐标
id_to_coord = @(id) [floor((id-1)/4)+1, mod(id-1,4)+1];

% 测试
disp(coord_to_id(3,2)); % 输出 10
disp(id_to_coord(10));  % 输出 [3,2]

3.4.2 上下左右移动动作的MATLAB向量化实现

沿用前述 actions 结构体定义四方向移动:

actions = setup_actions();

function acts = setup_actions()
    acts(1) = struct('id',1,'name','Up',   'delta',[-1,0]);
    acts(2) = struct('id',2,'name','Down', 'delta',[1,0]);
    acts(3) = struct('id',3,'name','Left', 'delta',[0,-1]);
    acts(4) = struct('id',4,'name','Right','delta',[0,1]);
end

结合状态转移函数,即可模拟完整行走过程:

current = [1,1]; % 起点
target  = [4,4]; % 终点
path = current;

for step = 1:10
    action_id = randi(4); % 随机选动作
    [r, current, done] = env_step(action_id, current, target, actions, [4,4]);
    path = [path; current];
    if done
        fprintf('第%d步到达终点!累计奖励: %d\n', step, r);
        break;
    end
end

disp('行走路径:');
disp(path);

该案例完整呈现了从状态编码、动作定义到环境交互的全流程,为下一章奖励函数设计和Q学习训练奠定了坚实基础。

4. 奖励函数与学习参数优化

在强化学习系统中,智能体的学习效率和最终性能高度依赖于奖励信号的设计质量以及关键超参数的合理配置。Q学习作为一种基于价值的无模型方法,其核心机制是通过最大化累积回报来驱动策略优化,而这一过程的成败首先取决于 奖励函数是否能够准确反映任务目标 ,其次则由学习率(α)、折扣因子(γ)和探索策略中的ε等参数共同决定训练的稳定性与收敛性。本章将深入剖析奖励工程的核心原则,并结合MATLAB平台提供可复现的实现路径。同时,针对不同参数对学习行为的影响展开实验级分析,提出系统化的调优方案。

4.1 奖励函数设计准则

奖励函数是连接环境动态与智能体学习目标之间的桥梁。它不仅定义了“什么是好”,还直接影响Q值更新的方向与速度。一个设计不当的奖励函数可能导致学习缓慢、陷入局部最优甚至完全失败。因此,必须从任务语义出发,科学构建激励机制。

4.1.1 稀疏奖励与稠密奖励的对比分析

稀疏奖励指仅在特定事件发生时(如到达目标或碰撞障碍物)才给予非零反馈;而稠密奖励则在整个状态转移过程中持续提供细粒度的正负激励信号。两者各有适用场景。

类型 特点 优点 缺点 适用场景
稀疏奖励 只在关键节点有反馈(如+1/-1) 避免人为偏见,符合真实世界设定 学习困难,样本效率低 游戏通关、机器人抓取
稠密奖励 每步都有连续反馈(如距离奖励) 加速学习,引导性强 易引入设计偏差,泛化能力弱 路径规划、控制任务

以网格世界为例,若只在终点给予+10奖励,则属于典型稀疏奖励设置:

function reward = get_sparse_reward(next_state, goal_state)
    if isequal(next_state, goal_state)
        reward = 10;
    else
        reward = 0;
    end
end

代码逻辑逐行解读
- 第2行:定义函数 get_sparse_reward ,输入为下一个状态 next_state 和目标状态 goal_state
- 第3-5行:判断是否到达目标,若是则返回高奖励10,否则无奖励
- 参数说明: next_state 为当前动作执行后的状态向量, goal_state 为预设的目标坐标(如[4,4])

相比之下,稠密奖励可通过欧氏距离改善探索效率:

function reward = get_dense_reward(current_state, next_state, goal_state)
    dist_before = norm(current_state - goal_state);
    dist_after  = norm(next_state - goal_state);
    reward = (dist_before - dist_after) * 0.1; % 每缩短1单位距离得0.1分
    % 终点额外奖励
    if isequal(next_state, goal_state)
        reward = reward + 10;
    end
end

代码逻辑逐行解读
- 第2-3行:计算移动前后到目标的距离
- 第4行:根据距离减少量给予即时奖励,形成正向反馈
- 第6-8行:保留目标达成的高额奖励,兼顾长期目标
- 参数说明: norm() 为MATLAB内置函数,用于计算向量范数;系数0.1用于缩放奖励幅度防止震荡

图示:稀疏 vs 稠密奖励对探索效率的影响
graph TD
    A[初始状态] --> B{采取动作}
    B --> C[稀疏奖励: 仅终点+10]
    B --> D[稠密奖励: 每步按距离增益评分]
    C --> E[长时间无反馈 → 探索盲目]
    D --> F[每步获得方向提示 → 快速逼近]
    E --> G[学习慢, 易陷入随机游走]
    F --> H[学习快, 收敛稳定]

该流程图清晰展示了两种奖励结构如何影响智能体的信息获取节奏。稠密奖励提供了更丰富的梯度信息,有助于Q-learning在贝尔曼更新中更快传播价值。

4.1.2 目标导向型奖励结构的MATLAB编码实践

在实际应用中,往往需要融合多种奖励成分,形成复合式奖励函数。例如,在机器人导航任务中,可综合考虑距离缩减、避障惩罚和时间成本。

function reward = composite_reward(state, next_state, goal, obstacles, step_cost)
    base_reward = 0;

    % 成分1: 向目标靠近的程度
    d_curr = norm(state - goal);
    d_next = norm(next_state - goal);
    progress_reward = (d_curr - d_next) * 0.2;

    % 成分2: 是否进入障碍区域
    for i = 1:size(obstacles, 1)
        if isequal(next_state, obstacles(i,:))
            base_reward = base_reward - 5;
            break;
        end
    end

    % 成分3: 到达目标给予大奖
    if isequal(next_state, goal)
        base_reward = base_reward + 50;
    end

    % 成分4: 每步消耗小代价,鼓励尽快完成
    base_reward = base_reward - step_cost;  % 如step_cost=0.1

    reward = base_reward + progress_reward;
end

代码逻辑逐行解读
- 第2行:函数接受当前位置、下一位置、目标点、障碍物列表及步长代价
- 第5-7行:使用距离差作为“进展奖励”,强化趋近行为
- 第9-14行:遍历障碍物列表,检测是否触碰并施加大额惩罚
- 第16-18行:成功抵达目标时叠加高额正奖励
- 第21行:加入每步固定负奖励,避免拖延
- 最终奖励为各项之和,体现多目标权衡

这种模块化设计便于后期调整权重。例如可通过引入加权系数实现优先级控制:

w_progress = 0.8;   % 进展权重
w_obstacle = 2.0;   % 避障权重  
w_time     = 1.0;   % 时间效率权重
reward = w_progress*progress_reward - w_obstacle*collision_penalty - w_time*step_cost + goal_bonus;

此类设计已在MATLAB仿真环境中广泛应用于AGV调度、无人机航迹优化等工业场景,显著提升了策略的鲁棒性。

4.2 关键超参数调优策略

尽管Q学习具有理论收敛保障,但在实践中其表现严重依赖于超参数的选择。学习率α控制新信息的吸收速度,折扣因子γ决定对未来回报的关注程度。二者的选择直接关系到算法的稳定性与长远性能。

4.2.1 学习率(α)对收敛速度的影响实验

学习率α ∈ [0,1] 决定了每次Q值更新中新增误差所占的比例。过大会导致振荡不收敛,过小则学习迟缓。

% 实验设置:比较不同α下的累计回报曲线
alphas = [0.1, 0.3, 0.6, 0.9];
num_episodes = 500;
results = zeros(num_episodes, length(alphas));

for k = 1:length(alphas)
    alpha = alphas(k);
    Q_table = zeros(16, 4);  % 4x4网格,4个动作
    total_rewards = [];

    for ep = 1:num_episodes
        state = 1;  % 初始状态
        episode_reward = 0;
        while ~is_terminal(state)
            action = epsilon_greedy(Q_table, state, 0.1);
            next_state = transition(state, action);
            reward = get_reward(next_state);
            % Q更新公式
            Q_table(state, action) = Q_table(state, action) + ...
                alpha * (reward + 0.9*max(Q_table(next_state,:)) - Q_table(state,action));
            episode_reward = episode_reward + reward;
            state = next_state;
        end
        results(ep, k) = episode_reward;
    end
end

% 绘制结果
figure;
plot(results);
legend('α=0.1','α=0.3','α=0.6','α=0.9');
xlabel('Episode'); ylabel('Total Reward');
title('Impact of Learning Rate on Training Convergence');

代码逻辑逐行解读
- 第2行:测试四种不同学习率
- 第6-28行:外层循环遍历每个α值,内层进行500轮训练
- 第14行:采用ε-greedy选择动作(详见4.3节)
- 第17-19行:执行贝尔曼更新,其中α乘以TD误差
- 第26行:记录每轮总奖励用于后续可视化
- 第31-35行:绘制四条学习曲线对比

不同α值下的学习特性总结如下表:
α 值 收敛速度 波动程度 最终性能 推荐用途
0.1 稳定但偏低 数据噪声大、需稳定输出
0.3 中等 较高 通用推荐值
0.6 可能不稳定 快速原型开发
0.9 极快 剧烈震荡 易发散 不推荐用于生产

实验表明,α=0.3通常能在学习速度与稳定性之间取得良好平衡。此外,可采用自适应学习率策略,如随迭代次数衰减:

alpha = initial_alpha / (1 + decay_rate * episode_count);

此方式可在初期快速学习,后期精细微调,提升整体性能。

4.2.2 折扣因子(γ)在长期回报评估中的作用分析

折扣因子γ ∈ [0,1] 控制未来奖励的重要性。γ接近1表示重视长期收益,适合延迟奖励任务;γ较小则偏向即时回报,适用于短期决策。

gammas = [0.5, 0.7, 0.9, 0.99];
gamma_results = zeros(num_episodes, length(gammas));

for k = 1:length(gammas)
    gamma = gammas(k);
    Q_table = zeros(16, 4);
    for ep = 1:num_episodes
        state = 1;
        episode_reward = 0;
        while ~is_terminal(state)
            action = select_action(Q_table, state);
            next_state = env_step(state, action);
            reward = calc_reward(next_state);
            Q_table(state, action) = Q_table(state, action) + ...
                0.3 * (reward + gamma * max(Q_table(next_state,:)) - Q_table(state,action));
            episode_reward = episode_reward + reward;
            state = next_state;
        end
        gamma_results(ep, k) = episode_reward;
    end
end

figure;
plot(gamma_results);
legend('\gamma=0.5','\gamma=0.7','\gamma=0.9','\gamma=0.99');
xlabel('Episode'); ylabel('Cumulative Reward');
title('Effect of Discount Factor on Long-term Planning');

代码逻辑说明
- 核心差异在于第18行中 gamma 的取值变化
- γ越大,Q更新中未来最大Q值的权重越高,促使智能体关注远期回报
- 实验结果显示:γ=0.99虽能更好处理延迟奖励,但也更容易因估计误差积累而导致不稳定

γ值选择建议对照表:
γ 值 时间视野 适用任务类型 注意事项
0.5~0.7 短期 即时响应任务(如避障) 忽视长期目标风险
0.8~0.9 中长期 路径规划、资源分配 推荐默认区间
0.95+ 长远 延迟奖励任务(如游戏通关) 需配合经验回放防过估

在MATLAB中,可通过交互式滑块控件实时调节γ并观察Q值传播效果,极大便利了参数调试过程。

4.3 ε-greedy探索策略实现

探索与利用的平衡是强化学习的核心挑战之一。ε-greedy策略通过以概率ε随机选择动作(探索),以1−ε选择当前最优动作(利用),实现了简单有效的折衷。

4.3.1 贪婪与探索的平衡机制设计

在初始阶段,由于Q表未充分学习,贪婪选择易陷入次优策略。此时应增加探索比例;随着训练推进,逐步降低ε以聚焦最优路径。

function action = epsilon_greedy(Q_row, epsilon)
    if rand < epsilon
        action = randi(size(Q_row, 2));  % 随机选动作
    else
        [~, action] = max(Q_row);       % 选Q值最大的动作
    end
end

代码逻辑逐行解读
- 第2行:生成[0,1]均匀随机数,判断是否小于ε
- 第3行:若触发探索,则用 randi 在动作空间内随机采样
- 第5行:否则选取当前状态下Q值最高的动作
- 输入 Q_row 为Q表中对应状态的一行,代表各动作的价值估计

该策略易于实现且效果稳定,已成为Q学习的标准组件之一。

4.3.2 指数衰减式ε调度器的MATLAB编程

为实现探索程度的动态调节,常采用指数衰减策略:

\epsilon = \epsilon_{\min} + (\epsilon_{\max} - \epsilon_{\min}) \cdot e^{-\lambda \cdot t}

其中t为训练步数,λ为衰减速率。

function epsilon = decayed_epsilon(t, eps_min, eps_max, decay_lambda)
    epsilon = eps_min + (eps_max - eps_min) * exp(-decay_lambda * t);
end

% 使用示例
episode_count = 1:500;
eps_vec = arrayfun(@(t) decayed_epsilon(t, 0.05, 1.0, 0.01), episode_count);

figure;
plot(episode_count, eps_vec);
xlabel('Training Episode'); ylabel('\epsilon Value');
title('Exponentially Decaying Exploration Rate');
grid on;

代码逻辑说明
- arrayfun 对每一episode计算对应的ε值
- 初始ε=1.0(完全探索),最终趋于0.05(少量探索)
- 曲线平滑下降,避免突变影响策略稳定性

衰减策略对比表:
策略类型 公式 特点 MATLAB实现方式
线性衰减 ε = max(ε_min, ε_init - k·t) 下降均匀,可控性强 max(eps_min, init - rate*t)
指数衰减 ε = ε_min + (ε_max - ε_min)e^(-λt) 前期快后期慢,符合学习规律 exp() 函数
分段常数 piecewise constant 易调试,适合阶段性训练 if-elseif 判断

在复杂环境中,还可结合状态不确定性进行自适应探索,如使用UCB或Boltzmann探索替代ε-greedy,进一步提升样本效率。

4.4 训练过程监控与可视化

有效的监控手段是确保Q学习正常运行的关键。MATLAB提供了强大的绘图功能,可用于实时追踪学习进度、诊断问题并验证收敛性。

4.4.1 累计回报曲线绘制与收敛性判断

累计回报是最直观的性能指标。理想情况下,曲线应呈现上升趋势并趋于平稳。

% 存储每轮回报
reward_history = [];

for episode = 1:1000
    [total_reward, steps] = run_episode(Q_table, env);
    reward_history(end+1) = total_reward;
    % 平滑化显示
    if mod(episode, 50) == 0
        figure(1); clf;
        plot(reward_history, 'b-', 'LineWidth', 1);
        hold on;
        smoothed = movmean(reward_history, 50);
        plot(smoothed, 'r-', 'LineWidth', 2);
        xlabel('Episode'); ylabel('Reward');
        title(['Training Progress (Episode ', num2str(episode), ')']);
        legend('Raw', 'Smoothed (50-episode MA)');
        drawnow;
    end
end

代码逻辑说明
- 第6行:每轮结束后记录总奖励
- 第9-16行:每隔50轮刷新图像,避免频繁绘图拖慢训练
- movmean 计算滑动平均,消除噪声干扰
- drawnow 强制刷新图形窗口,实现实时监控

当曲线持续上升且波动减小时,可认为已接近收敛。若出现剧烈震荡,可能需调整α或γ。

4.4.2 利用MATLAB绘图函数实现Q值变化动态展示

为进一步理解价值传播过程,可可视化Q表的最大值演变:

q_max_history = [];

for episode = 1:500
    train_one_episode();  % 更新Q_table
    q_max_history(end+1) = max(Q_table(:));
end

figure;
plot(q_max_history, 'g-o', 'MarkerSize', 4);
xlabel('Episode'); ylabel('Max Q-value');
title('Propagation of Expected Future Rewards');
grid on;
Q值传播流程图(Mermaid)
flowchart LR
    S1[初始化Q(s,a)=0] --> S2[执行动作a]
    S2 --> S3[获得奖励r]
    S3 --> S4[观察新状态s']
    S4 --> S5[查找max Q(s',a')]
    S5 --> S6[更新Q(s,a) ← Q + α[r + γmaxQ' - Q]]
    S6 --> S7{是否终止?}
    S7 -- 否 --> S2
    S7 -- 是 --> S8[记录累计回报]
    S8 --> S9[下一轮开始]
    S9 --> S2

该图完整描绘了Q值从终端状态反向传播至起始状态的过程。在MATLAB中,可通过 imagesc(Q_table) 将Q值热力图动态展示,直观呈现价值扩散现象。

综上所述,合理的奖励设计与参数调优是Q学习成功的基石。借助MATLAB强大的数值计算与可视化能力,开发者不仅能高效实现这些机制,还能深入洞察学习动态,为后续扩展至深度强化学习奠定坚实基础。

5. Q学习算法集成与扩展应用

5.1 完整Q学习系统的模块整合

在完成Q表初始化、状态动作建模、奖励函数设计及学习参数调优等核心组件后,下一步是将这些独立模块有机整合为一个结构清晰、可复用的完整Q学习系统。通过模块化编程思想,我们可以将环境交互逻辑、策略选择机制、Q值更新规则分别封装为独立函数,提升代码的可读性与维护性。

以MATLAB为例,构建主控脚本 q_learning_main.m ,其主要流程如下:

% q_learning_main.m - Q学习主程序框架
clear; clc;

% 初始化环境与参数
[env, Q_table] = initialize_environment();  % 包含状态数、动作数、Q表初始化
alpha = 0.8;      % 学习率
gamma = 0.95;     % 折扣因子
epsilon = 0.9;    % 初始探索率
max_episodes = 1000;
episode_rewards = zeros(max_episodes, 1);

% 主训练循环
for ep = 1:max_episodes
    state = env.reset();
    total_reward = 0;
    done = false;
    while ~done
        % ε-greedy策略选择动作
        action = select_action(Q_table, state, epsilon);
        % 执行动作,获取反馈
        [next_state, reward, done] = env.step(action);
        % Q值更新(贝尔曼方程)
        td_target = reward + gamma * max(Q_table(next_state, :));
        td_error = td_target - Q_table(state, action);
        Q_table(state, action) = Q_table(state, action) + alpha * td_error;
        total_reward = total_reward + reward;
        state = next_state;
    end
    episode_rewards(ep) = total_reward;
    epsilon = max(0.05, 0.9 * exp(-0.005 * ep));  % 指数衰减
end

% 可视化训练过程
plot(episode_rewards); title('每轮次累计回报变化曲线'); xlabel('轮次'); ylabel('累计回报');

上述代码中各功能模块均通过函数接口解耦:
- initialize_environment() :返回环境对象和初始化Q表;
- select_action() :实现ε-greedy策略;
- env.step() :封装状态转移与奖励反馈;
- Q值更新严格遵循贝尔曼优化准则。

该架构支持快速替换环境模型或策略函数,便于后续扩展至更复杂任务。

5.2 经验回放机制引入

传统Q学习采用即时经验更新,样本利用率低且易受序列相关性影响。经验回放(Experience Replay)通过存储历史交互数据并随机采样进行批量训练,显著提升学习稳定性。

5.2.1 经验缓冲区的数据结构设计

在MATLAB中,可使用元胞数组或结构体数组实现经验存储。每条经验包含五元组 (s, a, r, s', done)

% 初始化经验回放缓冲区
ReplayBuffer.Capacity = 10000;
ReplayBuffer.Data = cell(ReplayBuffer.Capacity, 5);
ReplayBuffer.Count = 0;
ReplayBuffer.Index = 1;

% 存储单步经验
function add_experience(buffer, state, action, reward, next_state, done)
    buffer.Data{buffer.Index, :} = {state, action, reward, next_state, done};
    buffer.Index = mod(buffer.Index, buffer.Capacity) + 1;
    if buffer.Count < buffer.Capacity
        buffer.Count = buffer.Count + 1;
    end
end

5.2.2 随机采样与批量更新的MATLAB实现

从缓冲区中随机抽取小批量样本进行Q值更新:

batch_size = 32;
if ReplayBuffer.Count >= batch_size
    idx = randperm(ReplayBuffer.Count, batch_size);
    for i = 1:batch_size
        exp = ReplayBuffer.Data{idx(i), :};
        s = exp{1}; a = exp{2}; r = exp{3}; s_ = exp{4}; d = exp{5};
        target = r + gamma * (1-d) * max(Q_table(s_, :));
        Q_table(s, a) = Q_table(s, a) + alpha * (target - Q_table(s, a));
    end
end

此机制打破时间相关性,提高数据重用效率,尤其适用于稀疏奖励场景。

5.3 从表格型Q学习到深度Q网络(DQN)的演进思路

5.3.1 表格方法的局限性与神经网络替代方案

当状态空间极大或连续时(如图像输入),传统Q表面临“维度灾难”。例如,在 $100 \times 100$ 网格环境中,状态总数达 $10^4$,若动作数为4,则Q表需存储 $4 \times 10^4$ 项;若状态为浮点向量,则无法穷举离散化。

解决方案是引入函数逼近器——深度神经网络,将状态映射为动作价值估计:

方法 状态表示 存储方式 可扩展性
Q-table 离散索引 查找表
DQN 原始观测(如像素) 神经网络权重

5.3.2 在MATLAB中调用深度学习工具箱构建DQN原型

利用MATLAB Deep Learning Toolbox定义Q网络:

layers = [
    featureInputLayer(4)                   % 输入层(如状态维度)
    fullyConnectedLayer(64)
    reluLayer
    fullyConnectedLayer(64)
    reluLayer
    fullyConnectedLayer(numActions)        % 输出每个动作Q值
    regressionLayer];

options = trainingOptions('adam', 'InitialLearnRate', 0.001, ...
    'MaxEpochs', 1, 'Shuffle', 'every-epoch');

% 训练网络(伪代码示意)
for each batch
    inputs = [s1; s2; ...];                % 当前状态批
    targets = Q_targets;                   % 目标Q值
    net = trainNetwork(inputs, targets, layers, options);
end

结合目标网络(Target Network)与经验回放,即可实现稳定DQN训练。

5.4 应用实例:基于Q学习的机器人路径规划

5.4.1 构建障碍物环境与目标导航任务

设定一个 $10 \times 10$ 网格地图,其中:
- 起点: (1,1)
- 终点: (10,10)
- 障碍物:随机分布于中间区域

状态编码采用二维坐标展平为索引: state = (row-1)*10 + col
动作集为 {上, 下, 左, 右} ,对应位移 [−1,0], [1,0], [0,−1], [0,1]

奖励设计:
- 到达终点:+100
- 碰撞障碍:−10
- 其他:−1(鼓励最短路径)

5.4.2 实现自主避障与最短路径搜索的完整仿真流程

使用前面构建的Q学习框架进行训练,并可视化最优路径:

% 测试阶段:贪婪策略生成路径
path = [];
state = env.start_state;
while state ~= env.goal_state
    path = [path; ind2sub([10,10], state)];
    [~, action] = max(Q_table(state, :));
    [~, ~, ~, state] = env.step(action);  % 不更新环境
end
path = [path; ind2sub([10,10], env.goal_state)];

% 绘制路径
figure; imshow(map_image); hold on;
plot(path(:,2), path(:,1), 'r-', 'LineWidth', 2); 
scatter(path(1,2), path(1,1), 'bo'); scatter(path(end,2), path(end,1), 'go');
title('机器人最优路径规划结果');

mermaid格式流程图展示整体训练流程:

graph TD
    A[初始化环境与Q表] --> B{是否结束?}
    B -- 否 --> C[ε-greedy选择动作]
    C --> D[执行动作获得s',r]
    D --> E[更新Q值: Q(s,a)=Q+α(r+γmaxQ')]
    E --> F[存入经验回放缓冲区]
    F --> G[随机采样批量更新]
    G --> B
    B -- 是 --> H[降低ε,记录回报]
    H --> I{达到最大轮次?}
    I -- 否 --> A
    I -- 是 --> J[输出最优策略]

该系统成功实现了从感知到决策的闭环控制,验证了Q学习在实际工程问题中的可行性与扩展潜力。

本文还有配套的精品资源,点击获取 menu-r.4af5f7ec.gif

简介:Q学习是一种基于强化学习的算法,通过构建Q表来学习在不同状态下采取何种动作以最大化长期累积奖励。其核心更新规则基于贝尔曼最优方程,在MATLAB中可通过定义状态空间、动作空间、奖励函数和状态转移机制进行建模与仿真。结合ε-greedy策略实现探索与利用的平衡,并可通过引入经验回放和深度Q网络(DQN)提升性能。本项目包含完整的MATLAB代码示例,适用于游戏控制、机器人路径规划等场景,帮助学习者掌握Q学习的基本原理与实际应用方法。


本文还有配套的精品资源,点击获取
menu-r.4af5f7ec.gif

Logo

更多推荐