<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Agent on Hellokitty&#39;s Blog</title>
    <link>https://yangyang233333.github.io/tags/agent/</link>
    <description>Recent content in Agent on Hellokitty&#39;s Blog</description>
    <generator>Hugo</generator>
    <language>zh-CN</language>
    <lastBuildDate>Thu, 27 Aug 2026 15:10:20 +0800</lastBuildDate>
    <atom:link href="https://yangyang233333.github.io/tags/agent/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>tiny-llm：在 Apple Silicon 上从 Transformer 算子走到推理系统与 Agent</title>
      <link>https://yangyang233333.github.io/posts/tiny-llm-source-reading/</link>
      <pubDate>Thu, 27 Aug 2026 15:10:20 +0800</pubDate>
      <guid>https://yangyang233333.github.io/posts/tiny-llm-source-reading/</guid>
      <description>&lt;p&gt;如果你已经知道 Transformer 的基本结构，却仍然不清楚 vLLM 一类推理系统为什么需要 KV Cache、Continuous Batching、Paged Attention，以及这些技术最终如何支撑 Agent，&lt;code&gt;skyzh/tiny-llm&lt;/code&gt; 是一条很好的动手路径。&lt;/p&gt;
&lt;p&gt;它不是一个追求生产可用的迷你框架，而是一门以 Qwen3 和 MLX 为载体的系统课程：先用可读的数组运算实现模型，再围绕真实性能瓶颈写 Metal 内核，随后搭出动态批处理和分页缓存，最后把同一个本地模型接入带工具、检查点、压缩、评测和分支选择的 Agent 循环。&lt;/p&gt;
&lt;p&gt;截至 2026 年 8 月 27 日，项目约有 4.5k stars，使用 Apache-2.0 许可证。课程主体分为四周，已覆盖从注意力到受控 Agent 的完整主线。&lt;/p&gt;
&lt;h2 id=&#34;项目定位不是再写一个-transformer&#34;&gt;项目定位：不是“再写一个 Transformer”&lt;/h2&gt;
&lt;p&gt;很多教学项目止步于“加载权重并生成一句话”。tiny-llm 的不同之处，是把模型实现当作起点，而不是终点。&lt;/p&gt;
&lt;p&gt;它试图回答三个递进的问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;一个现代开源模型如何由矩阵运算变成文本？&lt;/li&gt;
&lt;li&gt;一个正确但缓慢的实现，如何通过测量和内核优化接近成熟框架？&lt;/li&gt;
&lt;li&gt;一个推理引擎如何进一步成为可暂停、可审计、可恢复的 Agent 执行器？&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;项目选择 Apple Silicon、MLX 和 Qwen3。统一内存让 CPU、GPU 和模型权重处在相对简单的硬件环境里；MLX 提供熟悉的 Python 数组接口，同时允许下沉到 Metal；Qwen3 则带有 GQA、QK Norm、BF16 激活和 4-bit 权重，足以暴露真实推理系统中的带宽、注意力与缓存问题。&lt;/p&gt;
&lt;p&gt;代码结构刻意分成两套：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;src/tiny_llm/&lt;/code&gt; 是学习者逐步补全的实现；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;src/tiny_llm_ref/&lt;/code&gt; 是参考实现，用于测试和基准对照；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;src/extensions/&lt;/code&gt; 与 &lt;code&gt;src/extensions_ref/&lt;/code&gt; 分别放置 Metal/C++ 扩展；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;tests_refsol/&lt;/code&gt; 按周和天组织验收测试；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;book/&lt;/code&gt; 是完整课程正文。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这种布局把“阅读—实现—测试—测量”闭成了环。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
