<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Agent on Leon Li · 李梁</title><link>https://notes.liliang.me/tags/agent/</link><description>Recent content in Agent on Leon Li · 李梁</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 02 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://notes.liliang.me/tags/agent/index.xml" rel="self" type="application/rss+xml"/><item><title>4 张 V100 跑满一整天</title><link>https://notes.liliang.me/posts/2026-10-02-qwen38-flash-next-24h-production/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://notes.liliang.me/posts/2026-10-02-qwen38-flash-next-24h-production/</guid><description>&lt;p&gt;前两篇写了怎么用 4 张 V100 跑 &lt;a href="https://huggingface.co/Qwen/Qwen3.8-Flash-Next"&gt;Qwen3.8-Flash-Next&lt;/a&gt;，这篇记一下它被真实业务用满一整天是什么样子。&lt;/p&gt;&#10;&lt;h2 id="跑的什么"&gt;跑的什么&lt;/h2&gt;&#10;&lt;p&gt;配置没变：4 张 V100 PCIe 32GB，每张卡限制在 200W，AWQ int4 量化，开了 MTP4，上下文最长 512K，最多 4 路并发，另外拿 64GB 内存做 KV 缓存。&lt;/p&gt;&#10;&lt;p&gt;业务是我自己的一条 Agent 流水线，没人看着自己跑：一个主 Agent 管调度和审核，3 个子 Agent 一页一页地读 PDF，把内容抽成结构化记录。&lt;/p&gt;&#10;&lt;p&gt;我挑了 10 月 1 日早上 8 点到第二天早上 8 点这 24 小时，中间没重启过。前 19 个多小时一直满载，后面活干完了，就闲下来了。&lt;/p&gt;&#10;&lt;h2 id="数字"&gt;数字&lt;/h2&gt;&#10;&lt;p&gt;这一天一共 1 万多个请求，输入 5.76 亿 token，输出 638 万 token。满载的时候，输出稳定在每秒 85 到 95 个 token，大部分时间有 3 路请求同时在跑，基本不用排队，没出过一次错，也没掉过线。&lt;/p&gt;&#10;&lt;p&gt;请求大多是子 Agent 发的，上下文在 5 万左右，每次输出两三百 token，十几秒就返回。主 Agent 的上下文会一直涨到 49 万左右，然后自动压缩一次。这一天压缩了一回，用了不到 3 分钟。&lt;/p&gt;</description></item></channel></rss>