<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI on QSysArch - Quantum Computer System Architecture</title><link>https://qsysarch.com/zh-hk/categories/ai/</link><description>Recent content in AI on QSysArch - Quantum Computer System Architecture</description><generator>Hugo</generator><language>zh-hk</language><lastBuildDate>Fri, 12 Sep 2025 00:00:00 +0000</lastBuildDate><atom:link href="https://qsysarch.com/zh-hk/categories/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>利用人工智慧改進量子系統</title><link>https://qsysarch.com/zh-hk/posts/using-ai-to-improve-quantum-systems/</link><pubDate>Fri, 12 Sep 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-hk/posts/using-ai-to-improve-quantum-systems/</guid><description>&lt;img src='https://qsysarch.com/images/qcs-NN-tight-coupling.webp' style="width:420px;max-width:100%;float:right;padding-left:20px;"&gt;&#10;&lt;p&gt;使用人工智慧，更準確地說是神經網路（NN），不僅是顯而易見的，而且幾乎是2025年任何系統的必備組成部分。毫不奇怪，關於這主題的研究論文層出不窮。然而，最新的研究透過將神經網路高效整合到量子控制系統中，將這一領域推向了新的高度。&lt;/p&gt;&#10;&lt;p&gt;本文以新加坡量子技術中心 &lt;a href="https://www.cqt.sg/" class="external-link" target="_blank" rel="noopener"&gt;CQT/NUS&lt;/a&gt; 的工作為基礎，更具體地說是以 Arthur Strauss 的研究為基礎。我有幸在上一次 &lt;a href="https://www.sqa-conference.org/" class="external-link" target="_blank" rel="noopener"&gt;SQA&lt;/a&gt; 活動中與他進行了討論和交流。&lt;/p&gt;&#10;&lt;h1 id="強化學習來幫忙"&gt;&#10; 強化學習來幫忙&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%b8%e7%bf%92%e4%be%86%e5%b9%ab%e5%bf%99"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;他們的想法非常吸引人：利用強化學習方法，基於旨在最大化控制效率的獎勵機制，幫助量子控制系統調整量子位元的控制（即量子閘）。你可能會問，這有什麼意義呢？如前文（&lt;a href="https://qsysarch.com/posts/2-wheres-my-qubit/" &gt;link&lt;/a&gt;）所述，量子位元是非常敏感的“實體”，需要格外注意。而神經網路的作用就在於此，它能夠幫助量化這種關注的質量，也就是我們常說的保真度。&lt;/p&gt;&#10;&lt;p&gt;這是如何工作的？強化學習基於觀察/動作的循環，透過迭代的環境 -&amp;gt; 智能體獎勵系統（下圖中的“a”）進行學習，通常使用 GPU 運行，然後，一旦學習完成，就在緊密耦合的矩陣乘法器（或&lt;a href="https://arxiv.org/html/2406.02528v1" class="external-link" target="_blank" rel="noopener"&gt;不&lt;/a&gt;！&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/quantum-reinforcement-learning.webp" alt="自旋量子位元與量子點電路" /&gt; 圖片來源：&lt;a href="https://www.nature.com/articles/s42005-021-00684-3" class="external-link" target="_blank" rel="noopener"&gt;Nature&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;請注意，由於觀測（也稱為量子位元讀出）會破壞量子態，因此學習週期首先重置量子位元狀態，執行控制閘，讀出量子位元狀態，並將資訊回饋給代理。&lt;/p&gt;&#10;&lt;h2 id="強化學習系統關鍵組件"&gt;&#10; 強化學習系統：關鍵組件&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%b8%e7%bf%92%e7%b3%bb%e7%b5%b1%e9%97%9c%e9%8d%b5%e7%b5%84%e4%bb%b6"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;讓我們詳細了解強化學習的 4 個組成部分：&lt;/p&gt;&#10;&lt;p&gt;*環境即量子控制器和量子位元本身。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;這些操作是調整射頻產生器引擎的不同“旋鈕”或脈衝參數。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;*觀察結果是量子位元在受到環境操縱後的特性。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;代理* 學習對觀察到的量子位元特徵做出反應的策略，並相應地調整脈衝參數。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="強化學習系統學習方法"&gt;&#10; 強化學習系統：學習方法&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%b8%e7%bf%92%e7%b3%bb%e7%b5%b1%e5%ad%b8%e7%bf%92%e6%96%b9%e6%b3%95"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;強化學習方法通常可以分為兩大類：基於價值的方法和基於策略梯度的方法。&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://gibberblot.github.io/rl-notes/single-agent/value-iteration.html" class="external-link" target="_blank" rel="noopener"&gt;基於價值的&lt;/a&gt;方法著重於估計價值函數並從中匯出策略。 &lt;a href="https://gibberblot.github.io/rl-notes/single-agent/policy-based.html" class="external-link" target="_blank" rel="noopener"&gt;基於策略梯度的&lt;/a&gt;方法透過梯度上升最大化預期累積獎勵來直接優化策略。&lt;/p&gt;&#10;&lt;p&gt;策略迭代的優點在於其收斂速度遠快於基於值的策略，儘管計算成本更高。而策略梯度演算法正是透過降低計算複雜度來發揮作用。策略梯度演算法範例，包括 &lt;em&gt;reinforce&lt;/em&gt; 演算法：&lt;/p&gt;&#10;&lt;img src='https://qsysarch.com/images/reinforcement-learning-01.webp' style=""&gt;&#10;&lt;p&gt;在上圖中，「s」代表狀態，「a」代表動作，「r」代表獎勵。&lt;/p&gt;&#10;&lt;h2 id="強化學習系統迭代與回合"&gt;&#10; 強化學習系統：迭代與回合&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%b8%e7%bf%92%e7%b3%bb%e7%b5%b1%e8%bf%ad%e4%bb%a3%e8%88%87%e5%9b%9e%e5%90%88"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;在強化學習中，回合和迭代是不同的概念：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;集數：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;一個事件是智能體與環境之間一系列完整的交互，從初始狀態開始，到終止狀態結束（或達到最大時間範圍後）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;例如：在西洋棋比賽中，一集就是一局完整的比賽－從棋盤開始到將死、和棋或認輸為止。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;迭代：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;在某些論文/代碼中，一次迭代可能意味著智能體與環境互動的一個時間步（狀態→動作→獎勵→下一個狀態）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;在最佳化上下文中，一次迭代可能意味著學習演算法的一次更新步驟（例如，一次梯度下降步驟，該步驟可能基於多個回合或轉換）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;</description></item></channel></rss>