<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Network on QSysArch - Quantum Computer System Architecture</title><link>https://qsysarch.com/zh-hk/categories/network/</link><description>Recent content in Network on QSysArch - Quantum Computer System Architecture</description><generator>Hugo</generator><language>zh-hk</language><lastBuildDate>Tue, 28 Oct 2025 00:00:00 +0000</lastBuildDate><atom:link href="https://qsysarch.com/zh-hk/categories/network/index.xml" rel="self" type="application/rss+xml"/><item><title>NVQLink：英偉達的GPU-量子統一系統架構</title><link>https://qsysarch.com/zh-hk/posts/nvqlink-system-architecture/</link><pubDate>Tue, 28 Oct 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-hk/posts/nvqlink-system-architecture/</guid><description>&lt;p&gt;我非常高興能成為 &lt;a href="https://qblox.com/newsroom/qblox-accelerates-utility-scale-quantum-computing-with-nvidia" class="external-link" target="_blank" rel="noopener"&gt;Qblox&lt;/a&gt; 團隊的一員，該團隊一直以來都在積極與 [Nvidia](&lt;a href="https://www.nvidia.com/en-us/solutions/quantus/sum-link" class="external-link" target="_blank" rel="noopener"&gt;https://www.nvidia.com/en-us/solutions/quantus/sum-link&lt;/a&gt; &lt;a href="https://nvidianews.nvidia.com/news/nvidia-nvqlink-quantum-gpu-computing" class="external-link" target="_blank" rel="noopener"&gt;NVQLink&lt;/a&gt; 標準，以此作為連接在 GPU、CPU 和 QPU（量子處理器，包括 Qblox 正在開發的前端量子控制器）上計算的異質系統的一種方式。&lt;/p&gt;&#10;&lt;p&gt;&lt;img src='https://qsysarch.com/images/nvqlink/nvqlink1.webp' style='width:50%;margin:0;padding:0;'&gt;&lt;img src='https://qsysarch.com/images/nvqlink/nvqlink2.webp' style='width:50%;margin:0;padding:0;'&gt;&lt;/p&gt;&#10;&lt;h1 id="nvqlink概覽"&gt;&#10; NVQLink概覽&#10; &lt;a class="heading-link" href="#nvqlink%e6%a6%82%e8%a6%bd"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;NVQLink 不是連接 GPU 和量子處理器的另一個“電纜”，而是一個完整的框架，允許互連從網路到軟體堆疊的異質設備：&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/nvqlink/connect-quantum-processing-units-qpus-with-gpus.webp" alt="NVQLink 高階系統架構" /&gt; 圖片來源：[Nandod](&lt;a href="https://www.naddod.com/blog/nvidia-nvqlink-introduction-connecting-quantum" class="external-link" target="_blank" rel="noopener"&gt;https://www.naddod.com/blog/nvidia-nvqlink-introduction-connecting-quantum&lt;/a&gt;&lt;/p&gt;&#10;&lt;h2 id="效能規格"&gt;&#10; 效能規格&#10; &lt;a class="heading-link" href="#%e6%95%88%e8%83%bd%e8%a6%8f%e6%a0%bc"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;關鍵的「硬體」規格著重於網路和運算資源的效能：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;網路吞吐量：從 GPU 到 QPU 最高可達 400 Gb/s。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;網路延遲：往返延遲（FPGA → GPU → FPGA）小於 4.0 微秒。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;GPU 硬體：基於 NVIDIA GB200 Grace Blackwell 超級晶片構建的即時主機，具有大量的 TFLOPS。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="為什麼需要-nvqlink"&gt;&#10; 為什麼需要 NVQLink&#10; &lt;a class="heading-link" href="#%e7%82%ba%e4%bb%80%e9%ba%bc%e9%9c%80%e8%a6%81-nvqlink"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;你可能會問：“這為什麼重要？”&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;它創建了一個開放標準，將量子硬體與加速的 GPU 計算緊密整合。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;它支援混合工作流程：神經網路校準、量子糾錯（QEC）等。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;它提供了一個將軟體和硬體整合在一起的開放平台，使任何人都能與量子電腦進行交互，而無需淹沒在浩瀚的知識海洋中，這要歸功於&lt;a href="https://developer.nvidia.com/cuda-q" class="external-link" target="_blank" rel="noopener"&gt;Cuda-Q&lt;/a&gt;。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;</description></item><item><title>GPUDirect RDMA：RoCE 封包的生命週期</title><link>https://qsysarch.com/zh-hk/posts/gpu-direct-from-rdma-from-pcie-to-using-doca/</link><pubDate>Sat, 18 Oct 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-hk/posts/gpu-direct-from-rdma-from-pcie-to-using-doca/</guid><description>&lt;style&gt;&#10;img[src$='#center']&#10;{&#10;display: block;&#10;margin: 0.7rem auto;&#10;}&#10;img[src$='#right']&#10;{&#10;width: 50%;&#10;float: right;&#10;padding-left: 10px;&#10;}&#10;&lt;/style&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/gpudirect-rdma-pcie/nvidia-dgx-spark.webp#right" alt="" style="width: 100%; max-width: 200px;"/&gt;&lt;/p&gt;&#10;&lt;p&gt;本備忘錄旨在了解 RDMA 的內部原理，特別是創建與 PCIe 子系統互連的「符合 RDMA 標準的網卡」所需的技術，例如與 &lt;a href="https://nvidianews.nvidia.com/news/nvidia-dgx-spark-arrives-for-worlds-ai-devperselo" class="external-link" target="_blank" rel="noopener"&gt;DGX Spark&lt;/a&gt; 整合的 2000-2000-000000033）圖。&lt;/p&gt;&#10;&lt;h1 id="rdma-作為客戶端伺服器協定"&gt;&#10; RDMA 作為「客戶端/伺服器」協定&#10; &lt;a class="heading-link" href="#rdma-%e4%bd%9c%e7%82%ba%e5%ae%a2%e6%88%b6%e7%ab%af%e4%bc%ba%e6%9c%8d%e5%99%a8%e5%8d%94%e5%ae%9a"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;讓我們先概述一下 RDMA 協定。&lt;/p&gt;&#10;&lt;h2 id="rdma-設定"&gt;&#10; RDMA 設定&#10; &lt;a class="heading-link" href="#rdma-%e8%a8%ad%e5%ae%9a"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;設定 RDMA 資料通道時，需要先將記憶體緩衝區註冊到網路卡才能使用。註冊過程包括以下步驟：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;固定內存，使其無法被作業系統交換。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;將位址轉換資訊儲存於網路卡。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;設定記憶體區域的權限。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;建立遠端金鑰+本機金鑰，供網路卡在執行 RDMA 動詞時使用。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="rdma-佇列對"&gt;&#10; RDMA 佇列對&#10; &lt;a class="heading-link" href="#rdma-%e4%bd%87%e5%88%97%e5%b0%8d"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;RDMA 通訊基於一組三個隊列。&lt;/p&gt;</description></item><item><title>RoCEv2：InfiniBand傳輸協議</title><link>https://qsysarch.com/zh-hk/posts/the-infiniband-transport-protocol-of-rocev2/</link><pubDate>Mon, 22 Sep 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-hk/posts/the-infiniband-transport-protocol-of-rocev2/</guid><description>&lt;p&gt;我曾在Spirent公司工作，這是一家測試測量公司，專門開發高效能網路測試系統。我們的產品名為&lt;a href="https://www.spirent.com/products/testcenter-hardware" class="external-link" target="_blank" rel="noopener"&gt;Test Center&lt;/a&gt;，當時我們與一支才華橫溢的團隊一起開發用於測試RoCEv2系統的系統。我的工作重點是優先權流控制（PFC），以及如何將其應用於基於800Gbps FPGA的「資料包分析器和產生器」（也稱為PGA）。&lt;/p&gt;&#10;&lt;p&gt;然而，我從未真正了解過第 4 層，這份備忘錄試圖透過闡述 InfiniBand 傳輸層 (L4) 的關鍵要素並用一些圖表將其視覺化來彌合這一差距。&lt;/p&gt;&#10;&lt;h1 id="rocev2框架"&gt;&#10; RoCEv2框架&#10; &lt;a class="heading-link" href="#rocev2%e6%a1%86%e6%9e%b6"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;讓我們從實際的 RoCEv2 幀開始：&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/rocev2-frame-format.webp" alt="RoCEv2 幀" /&gt;&lt;/p&gt;&#10;&lt;h2 id="基本傳輸頭-bth"&gt;&#10; 基本傳輸頭 (BTH)&#10; &lt;a class="heading-link" href="#%e5%9f%ba%e6%9c%ac%e5%82%b3%e8%bc%b8%e9%a0%ad-bth"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;BTH 標頭中包含的關鍵字段：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;操作碼：用於指定 RDMA 操作的類型，例如 RDMA_WRITE、RDMA_READ 等。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;目標佇列對：用於區分資料包的不同目標佇列對。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;確認請求：指示接收端是否需要對此資料包傳回 ACK。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;li&gt;&#10;&lt;p&gt;資料包序號 (PSN)：用於資料包序列跟踪，以確保可靠交付。&lt;/p&gt;&#10;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;由於UDP協定不可靠，訊框可能會遺失、亂序或重複，因此使用PSN來確保訊框的正確傳輸。然而，這也意味著IBTL需要有一種方法來請求幀重傳。這可以透過AETH頭部來實現，具體內容將在下文中描述。&lt;/p&gt;&#10;&lt;h2 id="擴展傳輸頭-eth"&gt;&#10; 擴展傳輸頭 (ETH)&#10; &lt;a class="heading-link" href="#%e6%93%b4%e5%b1%95%e5%82%b3%e8%bc%b8%e9%a0%ad-eth"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;InfiniBand傳輸層包含多個擴展頭部，用於特定功能。對於RDMA而言，最值得關注的兩個擴充頭部是RETH和AETH。&lt;/p&gt;&#10;&lt;h5 id="rdma-擴充傳輸頭-reth"&gt;&#10; RDMA 擴充傳輸頭 (RETH)&#10; &lt;a class="heading-link" href="#rdma-%e6%93%b4%e5%85%85%e5%82%b3%e8%bc%b8%e9%a0%ad-reth"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h5&gt;&#10;&lt;img src='https://qsysarch.com/images/RoCEv2-IBTH-RETH-frame.webp' style="width:320px;max-width:100%;float:right;padding-left:20px;"&gt;&#10;&lt;p&gt;RDMA_WRITE 操作需要多個元素，這些元素在 RETH 擴充標頭的各個欄位中表示。此報頭會將寫入操作的詳細資訊告知接收硬件，包括：&lt;/p&gt;</description></item><item><title>RDMA 和 InfiniBand 的複雜世界</title><link>https://qsysarch.com/zh-hk/posts/the-confusing-world-of-rdma-and-infiniband/</link><pubDate>Tue, 16 Sep 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-hk/posts/the-confusing-world-of-rdma-and-infiniband/</guid><description>&lt;img src='https://qsysarch.com/images/gpu-infiniband-nvlink.webp' style="width:380px;max-width:100%;float:right;padding-left:20px;"&gt;&#10;&lt;p&gt;在GPU領域，與RDMA相關的術語層出不窮：GPU-direct、NvLink、NVLink Fusion、InfiniBand、Quantum InfiniBand、GPUNetIO和DOCA。這令人眼花撩亂，但或許不必如此？&lt;/p&gt;&#10;&lt;p&gt;本文以個人備忘錄的形式寫成，試圖闡述各種技術，並用一些圖表將其視覺化。&lt;/p&gt;&#10;&lt;h1 id="gpu-direct-與-rdma行銷與科技"&gt;&#10; GPU Direct 與 RDMA：行銷與科技。&#10; &lt;a class="heading-link" href="#gpu-direct-%e8%88%87-rdma%e8%a1%8c%e9%8a%b7%e8%88%87%e7%a7%91%e6%8a%80"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="Link to heading"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;Link to heading&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;讓我們從官方 Nvidia 文件中令人困惑的 &lt;a href="https://developer.nvidia.com/blog/unlocking-gpu-accelerated-rdma-with-nvidia-doca-gpunetio/" class="external-link" target="_blank" rel="noopener"&gt;GPUNetIO&lt;/a&gt; 頁面開始：&lt;/p&gt;&#10;&lt;p&gt;請注意，RDMA 是遠端直接記憶體存取協定的縮寫，該協定允許從一台電腦的記憶體向另一台電腦的記憶體進行遠端直接記憶體訪問，而無需任何一台電腦的作業系統參與。 ……請勿將其與 GPUDirect RDMA 混淆，後者與 RDMA 協定無關。&lt;/p&gt;&#10;&lt;p&gt;明白了，GPUDirect RDMA 和 RDMA 協定並不相同！但是，GPUDirect RDMA 至少是否使用了 RDMA 協定呢？我希望如此；否則，那就太令人困惑了。&lt;/p&gt;&#10;&lt;p&gt;GPUDirect RDMA 是 NVIDIA GPUDirect 技術家族中的一項技術。它使網卡能夠直接存取 GPU 內存，繞過 CPU 內存複製和作業系統例程，從而實現資料的收發。任何支援乙太網路、InfiniBand 或 RoCE 的網路框架都可以啟用 GPUDirect RDMA。&lt;/p&gt;&#10;&lt;p&gt;好的，至少有一點很明確：GPUDirect RDMA 可以實現在任何傳輸層上，無論是乙太網路 (ETH) 還是 InfiniBand (IB)。但是，GPUNetIO 是什麼？它與 RDMA 又有什麼關係呢？答案很簡單。顧名思義，GPUNetIO 是基於網路的 GPU Direct RDMA 實現，透過網路卡實現。這並不意味著 GPU Direct 必須由網路卡驅動，而只是說 GPUNetIO 是針對特定網路卡類型的專用版本。&lt;/p&gt;</description></item></channel></rss>