<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Asic on QSysArch - Quantum Computer System Architecture</title><link>https://qsysarch.com/zh-cn/categories/asic/</link><description>Recent content in Asic on QSysArch - Quantum Computer System Architecture</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 10 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://qsysarch.com/zh-cn/categories/asic/index.xml" rel="self" type="application/rss+xml"/><item><title>半导体计量学：原子尺度测量</title><link>https://qsysarch.com/zh-cn/posts/semiconductor-metrology/</link><pubDate>Fri, 10 Jul 2026 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-cn/posts/semiconductor-metrology/</guid><description>&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/asic-metrology/how-to-make-a-sillicon-chip.webp#right-300px" alt="" /&gt;本简短备忘录总结了半导体计量学中使用的各种方法，用于硅晶圆检测。&lt;/p&gt;&#10;&lt;p&gt;半导体计量学涉及对用于生产专用集成电路（ASIC）的晶圆进行精确测量和分析。其目标是确保器件制造过程中原子级晶体管布局的质量和性能，因为即使制造过程中出现皮米级的偏差也会影响良率。&lt;/p&gt;&#10;&lt;h1 id="计量技术"&gt;&#10; 计量技术&#10; &lt;a class="heading-link" href="#%e8%ae%a1%e9%87%8f%e6%8a%80%e6%9c%af"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;以下是一些用于质量测量的技术和仪器，以及它们在测量过程中的作用概述：&lt;/p&gt;&#10;&lt;h2 id="光学显微镜2d"&gt;&#10; 光学显微镜（~2D） &#10;&lt;img class="glightbox" src="https://qsysarch.com/images//asic-metrology/optical-microscope.webp#right-h200px" alt="" /&gt;&#10; &lt;a class="heading-link" href="#%e5%85%89%e5%ad%a6%e6%98%be%e5%be%ae%e9%95%9c2d"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;传统的光学显微镜（用于生物学）需要光线直接穿过（“透射”）样本才能检测相位变化。然而，硅片完全不透明且反射率很高。由于光线无法穿过硅片，因此这些标准系统无法使用。&lt;/p&gt;&#10;&lt;p&gt;晶圆检测并非直接检测晶圆表面，而是利用反射光，并有几种不同的方法：明场、暗场和微分干涉对比 (DIC)。明场检测使用垂直照射到晶圆上并反射回来的光线，而暗场检测则使用以较大倾斜角度照射到晶圆上的光线，这种方法可以检测凸起的缺陷，例如颗粒污染、细微划痕和微缺陷。&lt;/p&gt;&#10;&lt;p&gt;对于晶圆而言，最有趣的显微镜是微分干涉对比显微镜（DICC）。它利用偏振光和特制的沃拉斯顿棱镜将光线分成两束，使其在晶圆表面反射，然后再重新组合。通过对晶圆进行类似三维的观察，它可以揭示微观的高度差异和表面纹理。&#10;&lt;img class="glightbox" src="https://qsysarch.com/images//asic-metrology/optical-microscopy-reflected-light-differential-inference-contrast.webp" alt="" /&gt; (图片来源：&lt;a href="https://www.microscopyu.com/techniques/dic/reflected-light-dic-microscopy" class="external-link" target="_blank" rel="noopener"&gt;尼康显微镜&lt;/a&gt;)&lt;/p&gt;&#10;&lt;h2 id="扫描电子显微镜-sem"&gt;&#10; 扫描电子显微镜 (SEM) &#10;&lt;img class="glightbox" src="https://qsysarch.com/images/asic-metrology/scanning-electron-microscope-internal.webp#right-h300px" alt="" /&gt; &#10;&lt;img class="glightbox" src="https://qsysarch.com/images//asic-metrology/scanning-electron-microscope.webp#right-h200px" alt="" /&gt;&#10; &lt;a class="heading-link" href="#%e6%89%ab%e6%8f%8f%e7%94%b5%e5%ad%90%e6%98%be%e5%be%ae%e9%95%9c-sem"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;扫描电子显微镜 (SEM) 是半导体制造中最常用的仪器之一，因为它能够观察比光学显微镜小得多的特征（分辨率高 100 倍）。SEM 不使用光学显微镜，而是使用聚焦电子束扫描晶圆表面，从而生成晶圆形貌和成分的高分辨率三维图像。&lt;/p&gt;&#10;&lt;p&gt;与可以“一次性成像”的光学显微镜不同，扫描电子显微镜（SEM）需要用极细的电子束逐点“扫描”晶圆，然后重建图像，每个像素的亮度取决于从晶圆上相应位置检测到的电子数量。扫描过程不使用机械部件，而是利用磁线圈产生磁场，将电子束聚焦到仅几纳米宽的光斑上（与老式笨重的CRT电视机有些类似）。&lt;/p&gt;&#10;&lt;h2 id="原子力显微镜-afm"&gt;&#10; 原子力显微镜 (AFM) &#10;&lt;img class="glightbox" src="https://qsysarch.com/images/asic-metrology/atomic-force-microscopy.webp#right-h200px" alt="" /&gt;&#10; &lt;a class="heading-link" href="#%e5%8e%9f%e5%ad%90%e5%8a%9b%e6%98%be%e5%be%ae%e9%95%9c-afm"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;原子力显微镜 (AFM) 与扫描电子显微镜 (SEM) 有着本质区别：AFM 不使用电子束，而是利用柔性悬臂梁上的超细探针，在原子尺度上“感知”并绘制表面形貌图，就像盲人阅读盲文一样。AFM 测量的是表面形貌。&lt;/p&gt;&#10;&lt;p&gt;与扫描电镜（SEM）类似，原子力显微镜（AFM）也是逐点扫描表面。然而，AFM 并非记录发射的电子，而是测量多个参数，包括探针高度、悬臂梁偏转和相互作用力，从而生成真正的三维表面图。&lt;/p&gt;&#10;&lt;p&gt;悬臂梁可以以多种模式与可观测对象相互作用：在接触模式下，探针尖端与晶圆保持持续接触；在轻敲模式下，悬臂梁在其共振频率附近振荡，与表面的短暂接触会改变其振荡幅度；此外，还有一种非接触模式，该模式利用吸引力作为测量原理，但其信噪比通常较低。&lt;/p&gt;&#10;&lt;h2 id="x射线衍射-xrd"&gt;&#10; X射线衍射 (XRD) &#10;&lt;img class="glightbox" src="https://qsysarch.com/images/asic-metrology/xray-diffractometer.webp#right-500px" alt="" /&gt;&#10; &lt;a class="heading-link" href="#x%e5%b0%84%e7%ba%bf%e8%a1%8d%e5%b0%84-xrd"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;X射线衍射（XRD）与以前的仪器非常不同，以前的仪器主要检测晶片的表面，而XRD探测材料内部的晶体（或原子）结构。&lt;/p&gt;&#10;&lt;p&gt;它是用于检测硅片晶体取向、晶格间距、应变和晶体质量等参数的最重要的无损检测仪器之一。X射线衍射（XRD）必不可少，因为即使硅片在“表面显微镜”下看起来完美无瑕，XRD也能检测到晶格的细微变化，而这些变化会对晶体管的性能和生产良率产生显著影响。&lt;/p&gt;&#10;&lt;div style='clear:both'&gt;&#10;&lt;p&gt;＃＃ 概括&lt;/p&gt;&#10;&lt;style&gt;&#10;table { width: 100%; }&#10;table, table tr * { border: 1px solid #888;}&#10;table tr td{ padding: 3px; text-align:center;}&#10;&#10;&lt;/style&gt;&#10;&lt;p&gt;| 方法 | # | 分辨率 | 速度 | 成本 | 典型用途 | | &amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash; | &amp;mdash;- | &amp;mdash;&amp;mdash;&amp;mdash;&amp;ndash; | &amp;mdash;&amp;mdash;&amp;mdash; | &amp;mdash;- | &amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;mdash;&amp;ndash; | | 光学 | ~ 2D | ~0.2 µm | 非常快 | 低 | 常规晶圆检测 | | 扫描电子显微镜 (SEM) | ~ 2D | 1–10 nm | 慢 | 高 | 详细缺陷分析 | | 原子力显微镜 (AFM) | 3D | &amp;lt;1 nm（垂直） | 非常慢 | 高 | 表面粗糙度测量 | | X射线 | 3D | 可变 | 中等 | 高 | 内部结构检测 |&lt;/p&gt;</description></item><item><title>张量处理单元 (TPU)：高级系统架构</title><link>https://qsysarch.com/zh-cn/posts/tpu-architecture/</link><pubDate>Fri, 12 Dec 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-cn/posts/tpu-architecture/</guid><description>&lt;img src='https://qsysarch.com/images/tensor-processors/tpu-vs-gpu.webp' style='width:350px;float:right;'&gt;&#10;&lt;p&gt;在人工智能能耗巨大的今天，张量处理单元（TPU）的出现改变了游戏规则。它是谷歌专门为机器学习任务定制设计的芯片。&lt;/p&gt;&#10;&lt;p&gt;这份简短的备忘录旨在提供 TPU 架构的高级系统视图，以及自 2016 年诞生以来 TPU 的发展演变。&lt;/p&gt;&#10;&lt;p&gt;我还会尝试回答这个关键问题：既然我们已经有了GPU，为什么还需要TPU？TPU有哪些GPU所不具备的优势？它们与神经形态集成电路相比如何？除了TPU和GPU之外，还有其他架构可供选择吗？&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/tensor-processors/tpu-evolution.webp" alt="张量处理单元随时间演变" /&gt; (来源：&lt;a href="https://cloud.google.com/transform/ai-specialized-chips-tpu-history-gen-ai" class="external-link" target="_blank" rel="noopener"&gt;Google Cloud&lt;/a&gt;)&lt;/p&gt;&#10;&lt;h1 id="tpu存在的意义以及它解决了哪些问题"&gt;&#10; TPU存在的意义——以及它解决了哪些问题&#10; &lt;a class="heading-link" href="#tpu%e5%ad%98%e5%9c%a8%e7%9a%84%e6%84%8f%e4%b9%89%e4%bb%a5%e5%8f%8a%e5%ae%83%e8%a7%a3%e5%86%b3%e4%ba%86%e5%93%aa%e4%ba%9b%e9%97%ae%e9%a2%98"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;TPU 与 GPU 有着相同的目标：通过实现大规模并行性来克服摩尔定律减缓带来的限制：与可用于处理通用计算的传统 CPU 不同，传统 CPU 在一定程度上通过多核概念实现了一定程度的并行性（这要归功于丹纳德缩放定律），TPU 和 GPU 是专门设计的硬件，用于处理简单和特定的任务，但效率远高于任何 CPU。&lt;/p&gt;&#10;&lt;p&gt;从宏观层面来说，可以说它们通过“牺牲通用性来换取性能”的方式，提供了比通用 CPU 或 GPU 更优异的性能和效率。&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/tensor-processors/systolic-array.webp#right" alt="Google Systolic Array" style="width: 100%; max-width: 480px;"/&gt;&lt;/p&gt;&#10;&lt;p&gt;TPU 从根本上来说是为神经网络使用的繁重线性代数任务而设计的，例如矩阵乘法和张量运算。&lt;/p&gt;&#10;&lt;p&gt;TPU 的核心是脉动阵列，它是一个处理单元矩阵（通常称为 &lt;em&gt;PE&lt;/em&gt;，在右图中表示为 &lt;em&gt;MAC&lt;/em&gt;），可以执行并行计算。&lt;/p&gt;&#10;&lt;p&gt;以 TPU 为例，这个处理单元（或称 MAC）是一个简单的 8 位乘法器，它将激活值（嵌入向量）与神经网络的权重相乘并累加。只有通过大规模并行执行此操作，TPU 才能实现比 CPU 高得多的吞吐量。GPU 也是如此！但首先，让我们回顾一下 TPU 的发展历程。&lt;/p&gt;&#10;&lt;h1 id="tpu-的演变"&gt;&#10; TPU 的演变&#10; &lt;a class="heading-link" href="#tpu-%e7%9a%84%e6%bc%94%e5%8f%98"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;h2 id="tpuv1第一代-tpu"&gt;&#10; TPUv1：第一代 TPU&#10; &lt;a class="heading-link" href="#tpuv1%e7%ac%ac%e4%b8%80%e4%bb%a3-tpu"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;TPUv1仅用了15个月就开发完成，其主要目标是提升神经网络的推理能力（并非学习能力，而仅仅是推理能力）。为此，谷歌需要矩阵乘法器，并且不仅要保证高速运行，还要降低功耗。降低功耗的关键在于提高内存局部性，例如减少外部存储器和TPU内存之间不必要的数据传输。这将提高单位控制时间的运算强度，即减少TPU等待数据的空闲时间。&lt;/p&gt;</description></item><item><title>神经形态集成电路：高级系统架构</title><link>https://qsysarch.com/zh-cn/posts/neuromorphic-ics-system-architecture/</link><pubDate>Fri, 28 Nov 2025 00:00:00 +0000</pubDate><guid>https://qsysarch.com/zh-cn/posts/neuromorphic-ics-system-architecture/</guid><description>&lt;p&gt;最近在讨论Neuralink公司时，我听说了神经形态处理单元（NPU）。Innatera Pulsar芯片（见右图）虽然与量子计算无关，但我认为花点时间了解一下这种新的处理架构会很有意思。事实上，该领域领先的集成电路供应商之一是一家名为Innatera的荷兰公司。Innatera最新的芯片Pulsar基于低功耗脉冲神经网络（见右图）。&lt;/p&gt;&#10;&lt;p&gt;在本备忘录中，我将尝试逆向工程尽可能多的信息，以了解这些神经形态集成电路的架构、脉冲神经网络的设计以及用于对这些设备进行编程的软件栈。&lt;/p&gt;&#10;&lt;h1 id="硬件架构"&gt;&#10; 硬件架构&#10; &lt;a class="heading-link" href="#%e7%a1%ac%e4%bb%b6%e6%9e%b6%e6%9e%84"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;这是对 Pulsar IC 架构图的重新绘制尝试（原始&lt;a href="https://www.embedded.com/innatera-pulsar-brings-brain-intelligence-to-the-edge/" class="external-link" target="_blank" rel="noopener"&gt;图像&lt;/a&gt;，并补充了&lt;a href="https://innatera.com/storage/app/media/Resources/Pulsar.pdf" class="external-link" target="_blank" rel="noopener"&gt;白皮书&lt;/a&gt;中的见解）：&lt;/p&gt;&#10;&lt;p&gt;&#10;&lt;img class="glightbox" src="https://qsysarch.com/images/neuromorphic-ics/architecture-of-Innatera-Pulsar-neuromorphic-microcontrolle.webp" alt="" /&gt;&lt;/p&gt;&#10;&lt;p&gt;我确实很喜欢使用 RISC-V CPU 的想法——这清楚地表明 Innatera 团队从一开始就做出了正确的架构决策。在 Innatera 早期的 &lt;a href="https://innatera.com/products/spiking-neural-processor-t1" class="external-link" target="_blank" rel="noopener"&gt;T1&lt;/a&gt; 芯片的一张示意图中，RISC-V CPU 与 &lt;a href="https://five-embeddev.com/riscv-user-isa-manual/Priv-v1.12/f.html" class="external-link" target="_blank" rel="noopener"&gt;F 扩展&lt;/a&gt;（浮点运算支持）捆绑在一起。&lt;/p&gt;&#10;&lt;p&gt;该集成电路集成了多种标准接口（SPI、I2C 等）和一个电源管理单元 (PMU)，用于在进入“睡眠模式”或“省电模式”时开启或关闭集成电路的某些部分。遗憾的是，除了一个球形电池组显示“小于 1mW”之外，我找不到任何关于实际功耗的数据。假设供电电压为 1.8V，则电流将小于 500 µA（I=W/V）。我还想知道“每个周期”的功耗指标是否相关：在这种情况下，假设频率为 100Hz（突触更新周期），则平均每次突触更新的电流为 5 µA。&lt;/p&gt;&#10;&lt;p&gt;Pulsar 最新发布的架构图显示了两个加速器：一个 CNN 和一个 FFT。我认为更广义的描述应该是 GEMM（通用矩阵乘法器，神经网络计算的关键）和 SFU（特殊功能单元，用于加速 FFT 计算）。更多信息请查看关于 GPU 架构的&lt;a href="https://qsysarch.com/posts/cuda-compiler-architecture/" &gt;帖子&lt;/a&gt;。此外，还有一个脉冲编码器-解码器，它似乎是作为 RISC-V 的协处理器开发的，但我没有找到更多细节。&lt;/p&gt;&#10;&lt;h1 id="脉冲神经网络架构"&gt;&#10; 脉冲神经网络架构&#10; &lt;a class="heading-link" href="#%e8%84%89%e5%86%b2%e7%a5%9e%e7%bb%8f%e7%bd%91%e7%bb%9c%e6%9e%b6%e6%9e%84"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h1&gt;&#10;&lt;p&gt;剩下的问题是关于脉冲神经网络（Spiking Neural Network，简称 SNN）：它是如何工作的？&lt;/p&gt;&#10;&lt;h2 id="比喻"&gt;&#10; 比喻&#10; &lt;a class="heading-link" href="#%e6%af%94%e5%96%bb"&gt;&#10; &lt;i class="fa-solid fa-link" aria-hidden="true" title="链接到标题"&gt;&lt;/i&gt;&#10; &lt;span class="sr-only"&gt;链接到标题&lt;/span&gt;&#10; &lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;我请 Gemini 用一个比喻向 8 岁的孩子解释脉冲神经网络。以下是他们给出的比喻：&lt;/p&gt;&#10;&lt;p&gt;把大脑想象成一个巨大的邮局，“神经元”就是传递信息的信使。&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;信使和笔记：&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;在普通的计算机程序中，每个通信节点都在不停地传递和发送数字。而在脉冲神经网络中，通信节点则非常安静且节能：它们只在发生重要事件（例如微小的电脉冲）时才发送一条简短的“嘿！”消息。&lt;/p&gt;</description></item></channel></rss>