<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI on QSysArch - Quantum Computer System Architecture</title><link>https://qsysarch.com/ja/categories/ai/</link><description>Recent content in AI on QSysArch - Quantum Computer System Architecture</description><generator>Hugo</generator><language>ja</language><lastBuildDate>Fri, 12 Sep 2025 00:00:00 +0000</lastBuildDate><atom:link href="https://qsysarch.com/ja/categories/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>量子システムを改善するためにAIを活用する</title><link>https://qsysarch.com/ja/posts/using-ai-to-improve-quantum-systems/</link><pubDate>Fri, 12 Sep 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/ja/posts/using-ai-to-improve-quantum-systems/</guid><description>&lt;img src='https://qsysarch.com/images/qcs-NN-tight-coupling.webp' style="width:420px;max-width:100%;float:right;padding-left:20px;"&gt;&#10;&lt;p&gt;AI、より正確にはニューラルネットワーク（NN）の利用は、2025年のあらゆるシステムにおいて、当然のことながらほぼ必須の要素となるでしょう。当然ながら、このテーマに関する研究論文は数多く発表されています。しかし、最新の研究では、量子制御システムへのニューラルネットワークの高性能な統合を可能にすることで、その限界をさらに押し広げています。&lt;/p&gt;&#10;&lt;p&gt;この記事は、シンガポール量子技術センター&lt;a href="https://www.cqt.sg/" class="external-link" target="_blank" rel="noopener"&gt;CQT/NUS&lt;/a&gt;の研究、特にアーサー・ストラウス氏の研究に基づいています。私は前回の&lt;a href="https://www.sqa-conference.org/" class="external-link" target="_blank" rel="noopener"&gt;SQA&lt;/a&gt;イベントで、ストラウス氏と意見交換をする機会に恵まれました。&lt;/p&gt;&#10;&lt;h1 id="強化学習が救世主となる"&gt;&#10; 強化学習が救世主となる&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%a6%e7%bf%92%e3%81%8c%e6%95%91%e4%b8%96%e4%b8%bb%e3%81%a8%e3%81%aa%e3%82%8b"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="見出しへのリンク"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;見出しへのリンク&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;彼らのアイデアは実に興味深いものです。強化学習のアプローチを用いて、量子制御システムが量子ビット制御（ゲートとも呼ばれる）を調整できるようにし、制御効率を最大化することを目的とした報酬システムに基づいて制御を行うというものです。なぜこれが重要なのか疑問に思うかもしれません。前の記事（&lt;a href="https://qsysarch.com/posts/2-wheres-my-qubit/" &gt;link&lt;/a&gt;）で説明したように、量子ビットは非常に繊細な「実体」であり、細心の注意が必要です。そして、ここでニューラルネットワークが登場し、この注意の質（忠実度とも呼ばれる）を定量化するのに役立ちます。&lt;/p&gt;&#10;&lt;p&gt;これはどのように機能するのでしょうか？強化学習は、反復的な環境→エージェント報酬システム（下の図の「a」）を介して学習される観察/行動のサイクルに基づいており、通常はGPUで実行され、学習後は量子制御システム（下の図の「b」）上の密結合行列乗算器（または&lt;a href="https://arxiv.org/html/2406.02528v1" class="external-link" target="_blank" rel="noopener"&gt;しない&lt;/a&gt;!)で実行されます。&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/quantum-reinforcement-learning.webp" alt="スピン量子ビットと量子ドット回路" /&gt; クレジット: &lt;a href="https://www.nature.com/articles/s42005-021-00684-3" class="external-link" target="_blank" rel="noopener"&gt;Nature&lt;/a&gt;&lt;/p&gt;&#10;&lt;p&gt;観測（キュービット読み出しとも呼ばれる）によって量子状態が破壊されるため、学習サイクルではまずキュービットの状態をリセットし、制御ゲートを実行し、キュービットの状態を読み出し、その情報をエージェントに供給します。&lt;/p&gt;&#10;&lt;h2 id="rlシステム主要コンポーネント"&gt;&#10; RLシステム：主要コンポーネント&#10; &lt;a class="heading-link" href="#rl%e3%82%b7%e3%82%b9%e3%83%86%e3%83%a0%e4%b8%bb%e8%a6%81%e3%82%b3%e3%83%b3%e3%83%9d%e3%83%bc%e3%83%8d%e3%83%b3%e3%83%88"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="見出しへのリンク"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;見出しへのリンク&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;強化学習の4つの構成要素を詳しく見ていきましょう。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;&lt;em&gt;環境&lt;/em&gt;とは、量子コントローラと量子ビット自体を指します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;これらの操作は、RF発生器エンジンのさまざまな「つまみ」またはパルスパラメータを調整することです。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;*観測とは、環境によって操作された後の量子ビットの特性のことです。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;エージェントは、観測された量子ビットの特性に反応し、それに応じてパルスパラメータを調整するポリシーを学習します。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="強化学習システム学習方法"&gt;&#10; 強化学習システム：学習方法&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%a6%e7%bf%92%e3%82%b7%e3%82%b9%e3%83%86%e3%83%a0%e5%ad%a6%e7%bf%92%e6%96%b9%e6%b3%95"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="見出しへのリンク"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;見出しへのリンク&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;強化学習の手法は、大きく分けて価値ベース型と方策勾配ベース型の2つのカテゴリーに分類できる。&lt;/p&gt;&#10;&lt;p&gt;&lt;a href="https://gibberblot.github.io/rl-notes/single-agent/value-iteration.html" class="external-link" target="_blank" rel="noopener"&gt;価値ベース&lt;/a&gt;手法は、価値関数を推定し、そこからポリシーを導出することに重点を置いています。&lt;a href="https://gibberblot.github.io/rl-notes/single-agent/policy-based.html" class="external-link" target="_blank" rel="noopener"&gt;ポリシー勾配&lt;/a&gt;手法は、勾配上昇法によって期待累積報酬を最大化することで、ポリシーを直接最適化します。&lt;/p&gt;&#10;&lt;p&gt;ポリシー反復の利点は、計算コストは高くなりますが、価値ベースの方法よりもはるかに速く収束することです。そこで、計算複雑度を低減するポリシー勾配アルゴリズムが登場します。&lt;em&gt;reinforce&lt;/em&gt; アルゴリズムを含むポリシー勾配アルゴリズムの例を以下に示します。&lt;/p&gt;&#10;&lt;img src='https://qsysarch.com/images/reinforcement-learning-01.webp' style=""&gt;&#10;&lt;p&gt;上記の図において、「s」は状態、「a」は行動、「r」は報酬を表します。&lt;/p&gt;&#10;&lt;h2 id="強化学習システム反復とエピソード"&gt;&#10; 強化学習システム：反復とエピソード&#10; &lt;a class="heading-link" href="#%e5%bc%b7%e5%8c%96%e5%ad%a6%e7%bf%92%e3%82%b7%e3%82%b9%e3%83%86%e3%83%a0%e5%8f%8d%e5%be%a9%e3%81%a8%e3%82%a8%e3%83%94%e3%82%bd%e3%83%bc%e3%83%89"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="見出しへのリンク"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;見出しへのリンク&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;強化学習において、エピソードとイテレーションは異なる概念である。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;エピソード:&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;エピソードとは、エージェントと環境との間の一連の完全な相互作用であり、初期状態から始まり、終端状態（または最大時間範囲）で終了します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;例: チェスのゲームでは、1エピソードは完全なゲーム、つまり開始盤面からチェックメイト、引き分け、または投了までを指します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;反復:&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;一部の論文やコードでは、1回の反復はエージェントと環境の相互作用の1つの時間ステップ（状態→行動→報酬→次の状態）を意味する場合があります。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;最適化の文脈では、1回の反復とは、学習アルゴリズムの1回の更新ステップ（例えば、複数のエピソードや遷移に基づく勾配降下法の1ステップ）を意味する場合があります。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;img src='https://qsysarch.com/images/reinforcement-learning-02.webp' style=""&gt;&#10;&lt;p&gt;それでは、エピソードのサンプリングから始めて、これらのアイデアを一つずつ実行に移していきましょう。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;エピソードは、キュービットが &lt;em&gt;|O&amp;gt;&lt;/em&gt; 状態にあるところから始まります。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;観察・行動ループを開始する&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;エージェントは量子ビットの状態を観測する&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;そして、そのポリシーに従って次のパルスセグメントのパラメータを選択します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;実際に動作を体験して探求する：&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;決定論的に「最善の」行動（例えば、最も確率の高い行動）を選択する代わりに、サンプリングとは、エージェントが確率に従って、その分布からランダムに1つの行動を選択することを意味します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;このサンプリングは、&lt;em&gt;reinforce&lt;/em&gt; メソッドにおいて不可欠です。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;&lt;em&gt;スコア&lt;/em&gt;関数を計算します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;ネットワークパラメータを特定の方向に微調整した場合に、選択された行動が発生する可能性がどれだけ高くなる（または低くなる）かを測定する。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;つまり、サンプリングされた動作に対して∇(𝜃)を評価します。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;パルスプログラムの終了時に報酬を計算します。&lt;/p&gt;&#10;&lt;p&gt;方策勾配強化学習では、スコアと報酬が共に学習の更新を促進する。&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;報酬：環境からの外部フィードバック（タスクのパフォーマンス）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;&lt;em&gt;スコア&lt;/em&gt;: ポリシーのパラメータに対する内部感度（対数確率の勾配）。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h1 id="実践的な徹底解説フラックスとジャックス"&gt;&#10; 実践的な徹底解説：フラックスとジャックス&#10; &lt;a class="heading-link" href="#%e5%ae%9f%e8%b7%b5%e7%9a%84%e3%81%aa%e5%be%b9%e5%ba%95%e8%a7%a3%e8%aa%ac%e3%83%95%e3%83%a9%e3%83%83%e3%82%af%e3%82%b9%e3%81%a8%e3%82%b8%e3%83%a3%e3%83%83%e3%82%af%e3%82%b9"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="見出しへのリンク"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;見出しへのリンク&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;完成予定&lt;/p&gt;</description></item></channel></rss>