<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI on QSysArch - Quantum Computer System Architecture</title><link>https://qsysarch.com/zh-cn/categories/ai/</link><description>Recent content in AI on QSysArch - Quantum Computer System Architecture</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 12 Sep 2025 00:00:00 +0000</lastBuildDate><atom:link href="https://qsysarch.com/zh-cn/categories/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>利用人工智能改进量子系统</title><link>https://qsysarch.com/zh-cn/posts/using-ai-to-improve-quantum-systems/</link><pubDate>Fri, 12 Sep 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-cn/posts/using-ai-to-improve-quantum-systems/</guid><description>&lt;img src='https://qsysarch.com/images/qcs-NN-tight-coupling.webp' style="width:420px;max-width:100%;float:right;padding-left:20px;"&gt;&#10;&lt;p&gt;使用人工智能，更准确地说是神经网络（NN），不仅是显而易见的，而且几乎是2025年任何系统的必备组成部分。毫不奇怪，关于这一主题的研究论文层出不穷。然而，最新的研究通过将神经网络高效集成到量子控制系统中，将这一领域推向了新的高度。&lt;/p&gt;&#10;&lt;p&gt;本文以新加坡量子技术中心 &lt;a href="https://www.cqt.sg/" class="external-link" target="_blank" rel="noopener"&gt;CQT/NUS&lt;/a&gt; 的工作为基础，更具体地说是以 Arthur Strauss 的研究为基础。我有幸在上一次 &lt;a href="https://www.sqa-conference.org/" class="external-link" target="_blank" rel="noopener"&gt;SQA&lt;/a&gt; 活动中与他进行了讨论和交流。&lt;/p&gt;&#10;&lt;h1 id="强化学习来帮忙了"&gt;&#10; 强化学习来帮忙了&#10; &lt;a class="heading-link" href="#%e5%bc%ba%e5%8c%96%e5%ad%a6%e4%b9%a0%e6%9d%a5%e5%b8%ae%e5%bf%99%e4%ba%86"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;他们的想法非常吸引人：利用强化学习方法，基于旨在最大化控制效率的奖励机制，帮助量子控制系统调整量子比特的控制（即量子门）。你可能会问，这有什么意义呢？正如前文（&lt;a href="https://qsysarch.com/posts/2-wheres-my-qubit/" &gt;link&lt;/a&gt;）所述，量子比特是非常敏感的“实体”，需要格外关注。而神经网络的作用就在于此，它能够帮助量化这种关注的质量，也就是我们常说的保真度。&lt;/p&gt;&#10;&lt;p&gt;这是如何工作的？强化学习基于观察/动作的循环，通过迭代的环境 -&amp;gt; 智能体奖励系统（下图中的“a”）进行学习，通常使用 GPU 运行，然后，一旦学习完成，就在紧密耦合的矩阵乘法器（或&lt;a href="https://arxiv.org/html/2406.02528v1" class="external-link" target="_blank" rel="noopener"&gt;不&lt;/a&gt;！）上执行，在量子控制系统（下图中的“b”）上执行。&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/quantum-reinforcement-learning.webp" alt="自旋量子比特和量子点电路" /&gt; 图片来源：&lt;a href="https://www.nature.com/articles/s42005-021-00684-3" class="external-link" target="_blank" rel="noopener"&gt;Nature&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;请注意，由于观测（也称为量子比特读出）会破坏量子态，因此学习周期首先重置量子比特状态，执行控制门，读出量子比特状态，并将信息反馈给代理。&lt;/p&gt;&#10;&lt;h2 id="强化学习系统关键组件"&gt;&#10; 强化学习系统：关键组件&#10; &lt;a class="heading-link" href="#%e5%bc%ba%e5%8c%96%e5%ad%a6%e4%b9%a0%e7%b3%bb%e7%bb%9f%e5%85%b3%e9%94%ae%e7%bb%84%e4%bb%b6"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;让我们详细了解一下强化学习的 4 个组成部分：&lt;/p&gt;&#10;&lt;p&gt;*环境即量子控制器和量子比特本身。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;这些操作是调整射频发生器引擎的不同“旋钮”或脉冲参数。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;*观察结果是量子比特在受到环境操纵后的特性。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;代理* 学习对观察到的量子比特特征做出反应的策略，并相应地调整脉冲参数。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="强化学习系统学习方法"&gt;&#10; 强化学习系统：学习方法&#10; &lt;a class="heading-link" href="#%e5%bc%ba%e5%8c%96%e5%ad%a6%e4%b9%a0%e7%b3%bb%e7%bb%9f%e5%ad%a6%e4%b9%a0%e6%96%b9%e6%b3%95"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;强化学习方法通常可以分为两大类：基于价值的方法和基于策略梯度的方法。&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://gibberblot.github.io/rl-notes/single-agent/value-iteration.html" class="external-link" target="_blank" rel="noopener"&gt;基于价值的&lt;/a&gt;方法侧重于估计价值函数并从中导出策略。&lt;a href="https://gibberblot.github.io/rl-notes/single-agent/policy-based.html" class="external-link" target="_blank" rel="noopener"&gt;基于策略梯度的&lt;/a&gt;方法通过梯度上升最大化预期累积奖励来直接优化策略。&lt;/p&gt;&#10;&lt;p&gt;策略迭代的优势在于其收敛速度远快于基于值的策略，尽管计算成本更高。而策略梯度算法正是通过降低计算复杂度来发挥作用。策略梯度算法示例，包括 &lt;em&gt;reinforce&lt;/em&gt; 算法：&lt;/p&gt;&#10;&lt;img src='https://qsysarch.com/images/reinforcement-learning-01.webp' style=""&gt;&#10;&lt;p&gt;在上图中，“s”代表状态，“a”代表动作，“r”代表奖励。&lt;/p&gt;&#10;&lt;h2 id="强化学习系统迭代与回合"&gt;&#10; 强化学习系统：迭代与回合&#10; &lt;a class="heading-link" href="#%e5%bc%ba%e5%8c%96%e5%ad%a6%e4%b9%a0%e7%b3%bb%e7%bb%9f%e8%bf%ad%e4%bb%a3%e4%b8%8e%e5%9b%9e%e5%90%88"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;在强化学习中，回合和迭代是不同的概念：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;集数：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;一个事件是智能体与环境之间一系列完整的交互，从初始状态开始，到终止状态结束（或达到最大时间范围后）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;例如：在国际象棋比赛中，一集就是一局完整的比赛——从棋盘开始到将死、和棋或认输为止。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;迭代：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;在某些论文/代码中，一次迭代可能意味着智能体与环境交互的一个时间步（状态→动作→奖励→下一个状态）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;在优化上下文中，一次迭代可能意味着学习算法的一次更新步骤（例如，一次梯度下降步骤，该步骤可能基于多个回合或转换）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;img src='https://qsysarch.com/images/reinforcement-learning-02.webp' style=""&gt;&#10;&lt;p&gt;让我们逐一实现这些想法，首先从剧集抽样开始。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;每一集都从量子比特处于 &lt;em&gt;|O&amp;gt;&lt;/em&gt; 状态开始。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;启动观察-行动循环&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;智能体观察量子比特的状态&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;并根据其策略选择下一个脉冲段的参数。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;通过体验活动来探索：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;采样不是确定性地选择“最佳”动作（例如概率最高的动作），而是根据概率从该分布中随机抽取一个动作。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;这种抽样在&lt;em&gt;强化&lt;/em&gt;方法中至关重要。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;计算&lt;em&gt;得分&lt;/em&gt;函数：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;衡量如果网络参数向特定方向调整，所选操作的可能性会增加（或减少）多少。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;换句话说，对采样动作计算 ∇(𝜃)。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;当脉冲程序结束时，计算其奖励。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;</description></item></channel></rss>