我用12年汽车零部件选型经验,看懂了AI Agent的Token省钱术
不是所有零件都上最高规格,不是所有任务都用最强模型
做了12年汽车零部件研发,我干过一件特别枯燥但特别重要的事,就是零部件选型。
一台车有几万个零件,每个零件都有不同的规格等级。你不可能给一个车门内饰板上ASIL-D功能安全等级,也不可能用一个五毛钱的接插件去跑刹车信号。
选型的本质就一句话:在满足要求的前提下,找到成本和性能的最优匹配点。
最近我在搭自己的AI自动化系统,突然发现一个问题:我的Agent系统不管干什么活儿,统统往最强的模型上扔。写一篇公众号草稿用GPT-4o,检查个IP白名单也用GPT-4o,生成每日简报还是GPT-4o。
这不就是当年我刚入行时犯的错误吗?什么都想上最高规格,结果BOM成本爆表,老板找你谈话。
我把汽车行业那一套选型思维搬过来,重新设计了Agent的任务分配逻辑。效果怎么样?同样的月度API预算,任务吞吐量翻了3倍。
下面拆开讲。
一、先说汽车行业的"选型分级"是怎么回事
在汽车零部件行业,选型分级是写在流程里的硬规矩。
拿电机举个例子。同样是驱动用的直流无刷电机:

三个场景,同一个品类,价格差10倍以上。新手工程师最容易犯的错误,就是把所有场景都按ASIL-D去选。理由很充分:"安全第一嘛。"
但你算过账吗?如果整台车所有零件都按最高规格选,整车成本至少翻30%。最终结果只有一个,产品定价超出市场接受范围,卖不出去。
所以成熟的工程团队有一套DFMEA(潜在失效模式与影响分析)流程来做这件事。它的核心思路是:
1. 先列出所有可能出问题的环节
2. 逐项评估严重度、发生频率、探测难度
3. 只对高风险项投入高规格资源
4. 低风险项用标准方案即可,把预算省下来打歼灭战
这套方法论我在这个行业用了12年,写了300多份检测报告。它救过我的项目,也救过我的KPI。
二、我的Agent系统犯了同样的错
回到AI这边。
我搭了一套自动化的内容生产系统,每天定时干活:采集资讯、写简报、审文章、推公众号、做视频、发社区互动。十几个自动化任务排满了一整天。
起初我没太在意模型选择的问题。反正WorkBuddy后台默认给了个云模型,我就全局统一用了。
直到上个月我看了下账单,发现两个问题:
第一,费用分布极度不均。
有个任务叫"GSD文章创作",它需要理解选题策略、调用16个基因文件、生成三版草稿再选优。这个任务复杂度高,用强模型完全合理。它消耗了总token量的60%左右,产出也是最高的,每天1-2篇高质量公众号文章。
但还有一类任务,比如"IP白名单检查"。它做的事情很简单:调一次微信API,看返回码是不是正常,异常了就告警。整个任务前后不超过10行代码的执行量。这种任务也在用同一个强模型跑。
还有"每日简报生成"、"Meyo心跳巡检"、"Session-State健康检查"……一大堆轻量级例行任务,全部混在同一个模型池里。
这就好比你用ASIL-D级别的电机去开车窗升降器。能用吗?当然能。但钱花得太冤了。
第二,更隐蔽的问题是上下文浪费。
这是我从汽车行业的PPAP(生产件批准程序)阶段控制中悟出来的。
PPAP的核心思想是:不同阶段的产品状态,应该匹配不同程度的验证力度。原型件阶段做个外观尺寸检查就够了,量产阶段才需要全套性能测试+可靠性验证。你不能在还在敲定方案的时候就去跑10万次耐久循环。
对应到AI Agent这里,就是"上下文注入量"的问题。
我之前的做法是:每次任务启动,都把完整的工作记忆注入到系统prompt里。包括:
• 我的身份档案(12年汽车行业背景、转型方向、家庭情况)
• 内容策略(P0-P4优先级、标题公式、爆款规则)
• 历史数据追踪表(过去30天每篇文章的阅读/分享/评论数)
• 自动化任务清单(20+个任务的配置和调度规则)
• SkillEvolver进化机制文档(四轮迭代闭环设计)
这些加起来,大概8000-10000字。
对于"GSD文章创作"这种重量级任务来说,这些上下文都是必要的。它需要知道我是谁、什么风格、什么策略、历史上什么效果好、什么效果差。
但对于"IP白名单检查"这个任务呢?它只需要知道一件事:微信API的调用地址和凭证位置。剩下的7900多字上下文,全是浪费。它们不仅消耗了不必要的token输入,还可能稀释模型对真正关键信息的注意力。
这就像你在做一份简单的来料检验报告,却把整车开发全套DVPR测试规范都摊在桌面上。有用的信息淹没在一堆无关材料里,效率怎么可能高?
三、我用DFMEA思路给Agent做了个选型矩阵
发现问题之后,我做了一件很"工程师"的事,拉了个Excel表。
我把所有自动化任务逐一拆解,从四个维度打分:
然后根据得分,把任务分成了三级:
T1级:旗舰任务(强模型 + 完整上下文)
这类任务是系统的核心产出,容不得马虎。
• GSD文章创作:需要理解策略、调用基因库、多草稿选优。用最强模型,注入全部工作记忆。
• 视频流水线(周日完整版):20段×8秒的视频编排,需要理解文章情感走向和画面节奏。
• 橙皮书/深度报告:月度长文,5000字以上的结构化输出。
占比约15%的任务,吃掉了合理比例的高额预算。这就像EPS转向电机,该花的钱一分不能少。
T2级:标准任务(标准模型 + 精简上下文)
这类任务有明确的输入输出格式,不需要太多创造性。
• 每日Top10简报:资讯聚合+摘要生成,格式固定。注入策略摘要(200字内),不需要完整历史数据。
• WorkBuddy企业版文章:基于选题池的模板化写作。注入选题规则+标题公式即可。
• PPT自救指南系列:模板驱动的内容生成。注入Eric四条铁律+PPT场景库索引。
• Meyo社区互动:读帖→评论,有明确的互动原则约束。注入互动规范(300字以内)。
占比约50%的任务,用中等模型跑,上下文砍掉三分之二。效果几乎不受影响,成本直接降下来。
T3级:轻量任务(轻量模型 + 最小上下文)
这类任务本质上是if-else判断或简单文本处理。
• IP白名单检查:调API→看返回码→记录状态。只需凭证地址,不需要任何策略上下文。
• Session-State健康检查:读文件→比对时间戳→标记过期项。纯机械操作。
• 知识库索引更新:扫描新增文件→提取摘要→写入向量库。格式化处理为主。
• 每日复盘日志追加:当日工作记录→append到日期文件。纯文本拼接。
占比约35%的任务,用最便宜的模型跑,上下文只传必要的参数。这类任务甚至不一定需要大语言模型,有些脚本直接用代码逻辑就能完成。
四、落地之后的数字
这套分级方案上线了两周,我对比了一下前后的数据:
最直观的感受:以前每月看到API账单的时候会肉疼一下,现在看着舒服多了。省下来的预算被我投到了T1旗舰任务上,让GSD文章创作从"双草稿并行"升级到了"三草稿并行+自动选优",文章质量又上了一档。
这就是选型思维的威力:省下来的钱,比赚到的钱更实在。 因为它不需要你额外付出时间和精力,纯粹是资源配置优化带来的红利。
五、如果你也想给你的Agent做选型
如果你也想给自己的Agent做选型,这套操作步骤可以直接照搬:
第一步,列清单。 把你所有的自动化任务全部列出来,一行一个。不要遗漏任何一个,包括你觉得"不就是跑个脚本吗"的那种小任务。
第二步,打分。 从复杂度、创造性、容错率、频率四个维度给每个任务打1-5分。不用太精确,大致靠谱就行。目的是帮你形成直觉上的分级感。
第三步,分类。 按总分分成三档:
• 高分段(总分14-20)→ T1旗舰级
• 中分段(总分8-13)→ T2标准级
• 低分段(总分4-7)→ T3轻量级
第四步,配资源。 T1用强模型+全上下文,T2用标准模型+精简上下文,T3用轻量模型+最小上下文。如果你的平台支持自选模型的话,这一步改动不大;如果不支持,那至少可以把T3类任务的prompt大幅缩短。
第五步,盯指标。 上线后观察一周,重点关注两个数字:T2/T3任务的出错率是否明显上升,以及总成本是否真的下降了。如果出错率飙升,说明某个任务的分级偏低,上调一档即可。
整个过程大约2小时。对于有一定规模的Agent系统来说,这笔时间投入的ROI极高。
做了12年零部件选型,我一直觉得这个能力被低估了。它看起来不起眼,不就是挑个零件规格吗?但它背后是对需求本质的理解、对风险边界的把握、以及对成本结构的敏感。
这些能力搬到AI Agent领域,一样管用。毕竟,无论是造车还是搭系统,本质上都是在做同一件事:用有限的资源,在正确的位置上放正确的东西。
Eric | 12年汽车零部件研发从业者 × AI实践者