<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Heuristic on Welcome to Equinox&#39;s wiki！</title>
    <link>https://blog.equinox.wiki/tags/heuristic/</link>
    <description>Recent content from Welcome to Equinox&#39;s wiki！</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    
    <managingEditor>shixy2003@gmail.com (Equinox)</managingEditor>
    <webMaster>shixy2003@gmail.com (Equinox)</webMaster>
    
    <copyright>本博客所有文章除特别声明外，均采用 BY-NC-SA 许可协议。转载请注明出处！</copyright>
    
    <lastBuildDate>Tue, 04 Aug 2026 14:37:31 +0800</lastBuildDate>
    
    
    <atom:link href="https://blog.equinox.wiki/tags/heuristic/index.xml" rel="self" type="application/rss&#43;xml" />
    

    
    

    <item>
      <title>[CH09]策略梯度法</title>
      <link>https://blog.equinox.wiki/post/reinforcement-learning/ch09%E7%AD%96%E7%95%A5%E6%A2%AF%E5%BA%A6%E6%B3%95/</link>
      <pubDate>Tue, 04 Aug 2026 14:37:31 &#43;0800</pubDate>
      <author>shixy2003@gmail.com (Equinox)</author>
      <guid>https://blog.equinox.wiki/post/reinforcement-learning/ch09%E7%AD%96%E7%95%A5%E6%A2%AF%E5%BA%A6%E6%B3%95/</guid>
      <description>
        <![CDATA[<h1>[CH09]策略梯度法</h1><p>作者：Equinox（shixy2003@gmail.com）</p>
        
          
        
        <hr><p>本文2026-08-04首发于<a href='https://blog.equinox.wiki/'>Welcome to Equinox's wiki！</a>，最后修改于2026-08-04</p>]]>
      </description>
      
        <category>Reinforcement Learning</category>
      
    </item>
    
    

    <item>
      <title>[CH08]DQN</title>
      <link>https://blog.equinox.wiki/post/reinforcement-learning/ch08dqn/</link>
      <pubDate>Fri, 31 Jul 2026 13:03:13 &#43;0800</pubDate>
      <author>shixy2003@gmail.com (Equinox)</author>
      <guid>https://blog.equinox.wiki/post/reinforcement-learning/ch08dqn/</guid>
      <description>
        <![CDATA[<h1>[CH08]DQN</h1><p>作者：Equinox（shixy2003@gmail.com）</p>
        
          
        
        <hr><p>本文2026-07-31首发于<a href='https://blog.equinox.wiki/'>Welcome to Equinox's wiki！</a>，最后修改于2026-07-31</p>]]>
      </description>
      
        <category>Reinforcement Learning</category>
      
    </item>
    
    

    <item>
      <title>[CH07]神经网络和Q学习</title>
      <link>https://blog.equinox.wiki/post/reinforcement-learning/ch07%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C%E5%92%8Cq%E5%AD%A6%E4%B9%A0/</link>
      <pubDate>Mon, 27 Jul 2026 18:00:32 &#43;0800</pubDate>
      <author>shixy2003@gmail.com (Equinox)</author>
      <guid>https://blog.equinox.wiki/post/reinforcement-learning/ch07%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C%E5%92%8Cq%E5%AD%A6%E4%B9%A0/</guid>
      <description>
        <![CDATA[<h1>[CH07]神经网络和Q学习</h1><p>作者：Equinox（shixy2003@gmail.com）</p>
        
          
        
        <hr><p>本文2026-07-27首发于<a href='https://blog.equinox.wiki/'>Welcome to Equinox's wiki！</a>，最后修改于2026-07-27</p>]]>
      </description>
      
        <category>Reinforcement Learning</category>
      
    </item>
    
    

    <item>
      <title>[CH06]TD方法</title>
      <link>https://blog.equinox.wiki/post/reinforcement-learning/ch06td%E6%96%B9%E6%B3%95/</link>
      <pubDate>Fri, 24 Jul 2026 16:18:07 &#43;0800</pubDate>
      <author>shixy2003@gmail.com (Equinox)</author>
      <guid>https://blog.equinox.wiki/post/reinforcement-learning/ch06td%E6%96%B9%E6%B3%95/</guid>
      <description>
        <![CDATA[<h1>[CH06]TD方法</h1><p>作者：Equinox（shixy2003@gmail.com）</p>
        
          
        
        <hr><p>本文2026-07-24首发于<a href='https://blog.equinox.wiki/'>Welcome to Equinox's wiki！</a>，最后修改于2026-07-24</p>]]>
      </description>
      
        <category>Reinforcement Learning</category>
      
    </item>
    
    

    <item>
      <title>[CH05]蒙特卡洛方法</title>
      <link>https://blog.equinox.wiki/post/reinforcement-learning/ch05%E8%92%99%E7%89%B9%E5%8D%A1%E6%B4%9B%E6%96%B9%E6%B3%95/</link>
      <pubDate>Wed, 22 Jul 2026 14:46:40 &#43;0800</pubDate>
      <author>shixy2003@gmail.com (Equinox)</author>
      <guid>https://blog.equinox.wiki/post/reinforcement-learning/ch05%E8%92%99%E7%89%B9%E5%8D%A1%E6%B4%9B%E6%96%B9%E6%B3%95/</guid>
      <description>
        <![CDATA[<h1>[CH05]蒙特卡洛方法</h1><p>作者：Equinox（shixy2003@gmail.com）</p>
        
          
        
        <hr><p>本文2026-07-22首发于<a href='https://blog.equinox.wiki/'>Welcome to Equinox's wiki！</a>，最后修改于2026-07-22</p>]]>
      </description>
      
        <category>Reinforcement Learning</category>
      
    </item>
    
  </channel>
</rss>
