i

 1     绪论   1

1.1    研究背景和意义   1

1.2    国内外研究现状   1

1.3    论文结构   2

 2     微电网的组成部分  5

2.1    分布式电源   5

2.1.1    常见的分布式电源  5

2.1.2    光伏发电数学建模  5

2.1.3    风力发电数学模型  5

2.1.4    储能电池数学模型  6

2.2    微电网的运行   7

2.2.1    微电网的运行过程  7

2.2.2    控制模式   7

2.2.3    分层控制架构   8

 3     强化学习   9

3.1    强化学习的定义以及特点  9

3.1.1    策略   9

3.1.2    回报   9

3.1.3    最优动作价值函数   10

3.2    马尔可夫决策过程   10

3.2.1    马尔可夫性质   10

3.2.2    马尔可夫过程   11

3.2.3    马尔可夫奖励过程   11

3.2.4    贝尔曼方程   11

3.2.5    马尔可夫决策过程   11

3.3    深度 Q 网络   12

3.4    本章小结   13

 4     使用 DQN 进行微电网优化调度   15

4.1    对于微电网数学建模的一些限制   15

4.2    使用 DQN 算法调度的步骤   15

4.2.1    定义状态空间和动作空间   16

4.2.2    构建 DQN 网络   16

4.2.3    定义奖励函数   16

4.2.4    训练和优化 DQN 智能体   16

4.3    实验背景   16

4.4    实验与分析   18

4.4.1    实验环境   18

4.4.2    实验结果   18

4.5    实验总结   19

 5     使用粒子群算法进行微电网优化调度   21

5.1    粒子群算法简介   21

5.1.1    粒子群算法基本步骤   21

5.1.2    粒子群算法中的适应度函数   22

5.1.3    粒子群算法的优缺点   23

5.2    利用粒子群算法进行调度建模   23

5.2.1    目标函数   23

5.2.2    约束条件   23

5.2.3    粒子群算法中的变量表示   24

5.3    实验设置及实验结果分析   24

5.3.1    实验过程   25

5.3.2    实验结果   25

5.4    本章小结   25

       27

参考文献   29

     ················································································· 31

 1   绪论

1.1    研究背景和意义

自从 1882 年爱迪生在纽约曼哈顿建立起世界上第一个电力系统开始,电力系统开始不断发展,1886 年由威斯汀豪斯建成第一个交流送电系统。1894 年,尼亚加拉大瀑布水电站建成,交流电的优势迅速被确认,并迅速取得统治地位。随着经济发展,电力需求的上涨,输电距离和输电容量不断增大,推动了交流输电电压的不断提高。到二十一世纪,我国的超高压和特高压交流输电技术不断进步,2009年我国建成世界上首条 1000KV 特高压输变电工程。智能电网以其安全可靠、清洁环保、经济高效等特点进入各国视野,智能电网是一个动态发展的过程, 目前并没有一个确切的定义,美国能源部对于智能电网的定义是智能电网是利用数字技术来提高电网的可靠性、安全性和效率(经济效率和能源效率)。目前, 我国智能电网建设取得了显著成就。智能配电网、人工智能调度、智能终端等技术逐渐应用,为用户提供了更加精确的用电信息和更便捷的用电服务。智能电网的建设为我国能源结构调整和碳减排提供了技术支持。我国能源需求不断增长,环境问题的日益严重,新能源作为可持续发展的重要战略储备资源,研究新能源是可持续发展计划不可或缺的部分。相比于现阶段的传统集中式发电方式,分布式发电是指将发电设备分散在用户或负荷附近的发电方式,具有近距离供电、降低输电损耗、提高供电可靠性和灵活性等优势。常见的分布式发电技术有光伏发电、风力发电、储能发电等。光伏发电和风力发电等技术的发展,为分布式发电的普及和应用提供了坚实的基础。新能源与分布式发电的结合可以有效促进能源的可持续发展,降低了对传统能源的依赖,减少环境污染,实现绿色低碳循环发展。但分布式发电这项技术也有着诸多难题,主要是新能源技术的成本问题、能源存储技术的不足、电网规划和管理等方面的难题。为了进一步推动新能源和分布式发电的发展,需要加强技术研究和创新提高能源管理水平。电网调度作为电力系统的重要课题,在进行发电、输电、变电、配电以及用户用电的过程中,调度中心起到了至关重要的作用。为此,本文提出一种利用深度强化学习的方法进行微电网的优化调度策略,通过调度优化让能源得到合理利用。

1.2    国内外研究现状

在二十世纪末,美国电力协会开始微电网的可行性进行研究,并在二十一世纪初首次系统提出了微电网的概念。2003 年,美国能源部为了推动微电网技术的

发展和应用,建立了微电网研究与开发中心。欧洲的许多院校也开展了与微电网相关的研究项目,探索微电网的运行机制和控制策略。此外,国际能源署(IEA) 及国际电力工程师协会(IEEE)等国际组织也对微电网进行了深入的研究和标准制定。中国是全球最大的能源消费国和二氧化碳排放国。为了应对日益严峻的能源与环境问题,微电网成是中国能源革命的重要项目之一。国内许多高校和科研机构都开展了与微电网相关的研究工作。清华大学率先成立了微电网研究所,专门从事微电网的基础理论、关键技术的研究;中国电力科学研究院也开展了多个微电网研究项目,通过实验和模拟验证微电网的性能和控制策略。国内外许多学者不断提出自己对于微电网的分析和研究:狄义伟提出基于多 Agent 的电力系统智能调度的理念,以微电网能量管理系统(EMS)为基础,构建了智能调度框架[1] 袁志华对调度算法进行了模型建立,构建了基于多 Agent 的分层体系调度架构并设计了详细的调度界面[2] Ali Ghahgharaee Zamani 等人提出了一种电能和热能优化调度的分布模型,并提出了虚拟发电厂(VPP)的概念[3] ;朱思婷等人设计了具有良好拓展性的智能操作模型(IOKM), 并将 IOKM 分了三级架构提出了事实库动态构建方法[4] Linfei Yin 等人列举了机器学习在电力系统中的应用,如智能发电控制、智能调度等,给出了基于并行学习的调度机器人框架[5] ;苏劲鹏论述了运用动态规划方法对电力资源的优化调度问题[6] 。嵇文路等人分析了三种一体化电网调度控制系统,实现了较好的生命周期技术经济性[7] ;陈卫东等人提出了基于深度双向长短期记忆网络的微电网日前优化调度深度学习模型和方法[8] ;李静玲介绍了智能电网之于传统电网的区别并总结了其发展趋势[9] ;肖立业等人基于我国能源结构重大调整的长远战略,提出了构建全国统一的新能源电网的基本设想[10] 。王延江等人提出了一种具有进化功能的多 Agent 计算模型,适用于特征提取以及检测问题[11] 。李金洧对需求侧的用户负荷进行短期预测, 采用 LSTM 短时间记忆神经网络展开负荷预测工作[12] ;陈自强提出基于数据驱动的深度强化学习微电网优化调度策略[13] ;刘林鹏针对微电网中两种控制结构(集中式和分散),提出了基于强化学习的优化调度策略[14] ;黎海涛等人基于改进竞争深度 Q网络算法,对微电网进行能量管理与优化[15] ;丁明等人提出一种典型场景分析方法,建立微电网系统经济运行优化模型[16] Seyed Mohsen Hosseini 等人提出了一种新的稳健框架,用于住宅微电网的日前能源调度[17] 

1.3    论文结构

本文依据深度强化学习算法对微电网调度进行深入研究,提出一种新的调度策略。

本文分为五个章节,具体的章节安排如下:

第一章绪论。第一章对于课题研究背景进行了简单的介绍,引入了微电网概念的同时将集中式和分布式两种微电网模式进行了介绍。详细介绍了国内外的研究现状,最后介绍了本文的主要研究内容和研究安排。

第二章微电网的组成部分。第二章将对微电网的各个组成部分进行数学建模,以便于后续更方便的进行研究工作。

第三章强化学习基础理论。第三章对于深度强化学习算法进行了介绍,重点介绍对于微电网调度工作所使用的新算法。

第四章使用 DQN 进行微电网调度。第四章使用 DQN 算法进行微电网的优化调度,相较于传统的强化学习,提升了调度性能。

第五章使用粒子群算法进行微电网优化调度。第五章对于 DQN 算法的不足提出了 PSO 算法来解决微电网调度问题,改善 DQN 缺点的同时进一步降低了微电网的运营成本。

 2   微电网的组成部分

2.1    分布式电源

2.1.1    常见的分布式电源

常见的分布式电源有风力发电(Wind Turbine Generator)、光伏发电(Photo- voltaic Generator Solar Panel Generator)、柴油发电(Diesel Generator)、燃气发电(Natural Gas Generator)、微型燃气轮机(Micro Gas Turbine)、生物质能发电Biomass Energy)、地热能发电(Geothermal Energy)等。其中, 柴油发电多用于备用电源,微电网种常用的有风力发电、光伏发电以及微型燃气轮机。

2.1.2    光伏发电数学建模

理想的光伏电池板由光生电流源 (Iph)与代表 PN 结的二极管(VD ) 并联。

在公式2.1.1中,I0 表示二极管饱和电流、q 代表电子电量,T 表示光伏电池工作绝对温度值、A 表示二极管特性拟合系数、k 表示玻尔兹曼常数。此公式反映了端口电流与电压的关系,可以根据此公式描绘光伏电池的 I-U 特性曲线,但是,这个公式的复杂程度过高,其中参数不宜求解,同时方程不宜求解,不利于我们进行数学建模,因此,我们采用一种简化的方式来表示,如公式2.1.2所示。

在标准工况下(标准工况是指光伏电池的标准温度 Tref  和标准辐照度 sref  下,其中这两个技术参数由光伏电池厂家提供),Isc  指短路电流,Uoc  表示开路电压Im表示最大功率点电流,Um  表示最大功率点电压,这就是光伏电池板的数学模型。

2.1.3    风力发电数学模型

风力发电机的基本结构由叶片 (通常由强度高、重量轻的材料制作,如碳纤)、轮毂 (控制叶片桨距)、主轴 (连接发电机,将风能转化为机械能)、控制器 (测和控制风力发电机的运行状态)、齿轮箱 (增加主轴转速)、发电机 (将机械能转

化为电能)、冷却系统、风速仪等组成, 如图2.1所示

发电机

 2.1    风力发电机示意图

根据空气动能方程,我们可以得出风能动能的计算公式。

E 

PSv3                                                                               (2.1.3)

但在实际情况下,风轮并不能完全捕获空气动能,物理学家贝兹得出了风能捕获空气动能的效率上限为 59.3%,这个数值也被称为贝兹极限,也就是风能利用系数,所以风能利用系数 Cp  的值介于 0  0.593 之间,结合公式 2.3 和风能利用系数,我们可以得出风机的机械功率。

P 

CPPπr2 v3                                                                          (2.1.4)

在公式 2.4 中,r 为风轮半径,风能利用系数 Cp  是风力机叶尖速比 λ 和桨叶节距 β 的函数。

2.1.4    储能电池数学模型

微电网中的储能电池单位是一个复杂系统,我们需要考虑电池的充放电特性、能量转换效率、电池老化等因素。

首先我们定义电池的状态变量,比如电池的荷电状态(State of ChargeSOC)。

荷电状态描述了电池当前剩余电流与总容量的比例。

                                        (2.1.5)

在公式2.1.5中,SOC 是电池的荷电状态,取值范围通常为 0  1 ηc  是充电效率。pch  是充电功率(正值为充电,负值为放电)。ηd  放电效率。pdisch  是放电功率(正值为放电,负值为充电)。Q cap  是电池的总容量。

电池的充放电功率也受到其最大充放电功率的限制:

-pmax,disch  ≤ pdisch  ≤ pmax,ch                                                      (2.1.6)

在公式2.1.6中,pmax,disch  是电池的最大放电功率。pmax,ch  是电池的最大充电功率。

电池的老化可以通过一个与充放电循环次数、SOC 深度、温度等因素相关的函数来表示,这通常是一个经验模型,需要根据实验数据来确定。在实际应用中,还需要考虑电池的温度范围、充放电速率限制等。可以使用数值方法来求解上述微分方程,从而模拟电池的动态行为。同时,还需要根据具体的微电网控制策略来确定电池的充放电功率。

2.2    微电网的运行

2.2.1    微电网的运行过程

微电网是一个小型的电力系统,由分布式电源、负荷以及保护装置共同构成。它既可以独立运作,也可以与大型电网相连。并网和孤岛是其两种常见的运行方式。孤岛运行,即微电网独立工作,不与外部电网有能量交换。在输出功率不足时,会依赖储能设备进行供电,甚至在必要时会切断部分非关键负荷。而孤岛与并网之间的切换,就是微电网从独立状态转为与大电网连接的过程。若检测到外部电网出现问题或电能质量不佳,微电网会选择断开与主网的连接,转为孤岛状态,此时其内部的电源和储能设备将为负荷提供电力。我们的研究焦点主要集中在微电网在孤岛状态下的优化调度问题。图2.2简要展示了微电网的运行。

2.2.2    控制模式

第一种控制模式是主从控制。也就是我们选取一个主要的分布式电源作为主电源,采用定电压和定频率控制;其余的分布式电源采用额定功率运行,作为从电源。这种控制模式的优点是控制策略简单、可以充分发挥主要条件节点的作用、降低其余节点的调节,减少控制成本。缺点是对于平衡节点的稳定性要求高,一

 2.2    微电网组成示意图

但平衡节点出现故障,即使是微小的故障,也可能会导致整个微电网系统崩溃。

第二种控制模式是对等控制。也就是所有分布式电源均分担负荷增量并参与微电网系统调节,地位对等。对等控制相对于主从控制来说,负荷的变化由多个分布式电源共同承担,增加了系统可靠性。

2.2.3    分层控制架构

微电网孤岛分层控制架构是一种控制策略,用于解决孤岛直流微电网的稳定经济运行问题。该控制实体需要适当调节内部电压并有效协调发电机组操作,同时考虑负载和可再生能源的非确定性吸收/生产。为此, 通常采用跨越不同控制阶段、时间尺度和物理层的分层架构。堆叠一级、二级和三级的分层架构广泛用于孤岛直流微电网的运行和控制,该微电网由配电发电机组、负载和电力线组成。

一次控制是指维持孤岛电压和频率稳定,同时实现负荷功率在微电源间的分配。二次控制是指通过中央控制器或分布式控制机制对微电源进行二次调节,调节孤岛频率和关键节点电压。三次控制是指优化调度。其中, 一次控制是必备的,确保了微电网可以运行,但多次控制可以优化微电网的运行。

 3   强化学习

3.1    强化学习的定义以及特点

强化学习(Reinforcement Learning,简称 RL)是机器学习领域中的一种重要方法,旨在让智能体(agent)在与环境的交互过程中学习如何做出决策以最大化某种累积的奖励或回报。强化学习是一种试错方法,智能体通过尝试不同的行为,观察这些行为所带来的结果,并根据这些结果调整其未来的行为策略,从而逐渐学习到在特定环境下如何做出最优决策。强化学习的主要特点有如下几种:

试错学习:智能体通过与环境进行交互,尝试不同的行为,并观察这些行为所带来的结果,从而逐渐学习到如何做出最优决策。

延迟奖励:强化学习中的奖励通常是延迟的,即智能体需要在一系列行为之后才能获得奖励。这种延迟奖励的机制使得强化学习更加适用于解决具有长期依赖关系的问题。

值函数和策略:值函数是用来估算在特定状态下采取某一行为的预期回报,而策略则起到引导 Agent 在特定状态下如何做出行为选择的作用。

强化学习在许多领域都有广泛的应用,如游戏 AI、自动驾驶、机器人控制、自然语言处理、金融交易等。随着深度学习和大数据技术的发展,强化学习在解决复杂问题方面的潜力得到了进一步挖掘和应用。

3.1.1    策略

策略 (Policy) 是强化学习中的重要概念,我们规定一个函数 Policyπ , 其中,该函数是一个概率密度函数,公式如下。

π(a|S) = P(A = a|S = S)                                       (3.1.1)

公式3.1.1代表函数 policy π 的值为给定 state 状态下,agent 进行下一步的 action其中 π (a|s) 的取值范围为 [0, 1]。在每一个 Policy 下,就会有一个对应的奖励 (Re- ward), 强化学习的目标就是使得 Reward 的目标总和最大,便达到了训练的目的。

3.1.2    回报

回报 (Return) 是指在强化学习中的训练过程中累计的 Reward,用 ut  表示,公式如下

ut =Rt + Rt+1+Rt+2 + Rt+3 + · · ·                                  (3.1.2)

但在实际中,Rt +1   的权重低于 Rt   权重,因此我们定义折扣回报率 Discounted return 和折扣率 Y ,其中 Y  的取值范围为 [0, 1],公式如下

ut =Rt + YRt+1+Y2 Rt+2 + Y3 Rt+3 + · · ·                              (3.1.3)

其中的 Ri   由当前的状态 state i  和智能体做出的 Actioni  来共同决定。从金融投资回报的角度来理解,即时奖励比延时奖励更加诱人。同时 Y 的引入也可以体现出未来的不确定性。

3.1.3    最优动作价值函数

强化学习中的最优动作价值函数是核心概念之一,它评估了在特定状态下执行某个动作所带来的长远收益。该函数为智能体提供了在特定环境中进行最优行动选择的依据,旨在实现累积回报的最大化。简而言之,最优动作价值函数 Q*(S, a)揭示了在当前状态 S 下执行动作 a 所能获得的预期累积回报,它综合考量了未来所有潜在的奖励与状态变迁,从而体现出当前动作选择的长期影响。通过求解最优动作价值函数,智能体可以找到一个策略,使得在每个状态下都能选择出最优的动作。这个策略可以帮助智能体在各种不同的任务中取得更好的表现。需要注意的是,求解最优动作价值函数可能是一个复杂的过程,需要考虑到状态空间、动作空间以及奖励函数等多个因素。

3.2    马尔可夫决策过程

马尔可夫决策过程(Marokov decision processes)是强化学习问题在数学上的理想化形式,马尔科夫决策过程中的环境是完全可观测的,几乎所有的强化学习问题都可以在数学上表示为马尔可夫决策过程。

3.2.1    马尔可夫性质

马尔可夫性质指的是状态 st  具有马尔科夫性,当且仅当

P [st +1 |st ] = P [st +1 |s1, . . . , st ]                                 (3.2.1)

公式3.2.1表达的意思是,只需给定当前时刻的状态,未来是与历史无关的,其实,当前的状态也就是对过去的充分统计。马尔可夫性质将问题简化,同时简化后的模型具有与现实世界相符合的属性。

对于马尔可夫状态 S 及其后继状态 S,他们的状态转移概率定义为:

PSS′   = P [st +1  = S|st   = S]                                      (3.2.2)

Logo

更多推荐