← 上一章☰ 目录下一章 →
第三十四章
一次任务烧掉四毛二
卷四 · 我到底该讲哪一段 | 挂载真题 4 道(新E10、E6、F6、J4)| 织法 B · 战而后知

全自动信任梯子上线之后——我干了一件我一直该干但一直没干的事:算钱。

不算不知道。一次全自动任务从用户点击「开始」到任务结束——全流程是这样的:搜索关键词调一次模型判断、筛选岗位调一次、深度匹配调一次、生成开场白调一次、发送前安全检查调一次。也就是说——一次完整任务最少调五次模型。如果中间某个环节出错了需要重试——那就更多。峰值的时候我见过一次任务跑了十一次调用的记录——不是因为流程复杂——是因为Agent在一个步骤上反复失败反复重试——每次重试都在烧钱。

我用的模型按token收费。一次任务平均消耗大概六千到八千个token——折算下来单次任务的模型成本在四毛二分钱上下浮動。一天如果跑几百次任务——一个月下来就是两三千块。

四毛二一次——听着不多。但一个用户如果每天跑两次全自动——一个月就是二十五块二的模型成本——而他的月费只有九块九。也就是说——每来一个用户——我都在亏钱。用的越多——亏的越多。这个运营模型从一开始就是倒挂的。

一、我到底在为哪些事情付钱

我把一次全自动任务的详细日志翻出来——逐段逐段看每一轮模型调用到底在干什么。

第一轮调模型——搜索关键词。输入是「帮我搜一下杭州的AI产品经理岗位」——输出是一串搜索参数。坦白说——这个判断连模型都不需要——URL拼接就能解决——但我的Agent直接调了模型。第二轮调模型——筛选岗位。「从刚才搜到的五十个结果里选出五个最值得点进去看的」——这个需要一点理解——但中等模型完全够用——我却一直在调最强的那档。第三轮调模型——深度匹配。把岗位JD和候选人简历逐条比对——算出匹配度——这个确实需要比较强的理解能力——用贵模型是合理的。第四轮调模型——生成开场白。「根据JD和简历写一段自然得体的开场白」——需要创造力和语气把控——用贵模型也合理。第五轮调模型——发送前检查。「检查一下这条消息有没有违规词、语气对不对」——这个我一个正则表达式就能解决的问题——也在调大模型做。

五轮调用里——真正需要用到最强模型能力的——只有两到三轮。剩下的一半——用规则或者便宜的多的模型就能干——甚至干得更好。

但这还不是最让我崩溃的发现。日志里还藏着一个更隐蔽的问题——每次模型调用之前——Agent都会先问一次模型「我刚才调用到哪一步了」和「下一步应该做什么」。也就是说——它在每一步正式开始之前——先花一次调用的钱问路——然后再花一次调用的钱干活。问路那一次的钱——是完全浪费的。

搜索框在哪儿、登录按钮在哪儿、城市选择器在哪儿、搜索按钮在哪儿——这些问题的答案每次调用都一样——但Agent每次都在重复问。它就像一个没有地图的外卖骑手——每天跑同一个小区——每次到门口都要停下来问一遍物业「XX栋怎么走」。

我拉平了所有日志数据——发现一次全自动任务里大约有百分之六十的模型调用是在问「不需要智能的问题」。搜索框位置、按钮坐标、页面结构——这些信息一次拿到之后存下来就可以直接用了——根本不需要每次都问。相当于每次点外卖都要付一份外卖员的问路费——而且那个外卖员已经跑过一百次同一个地址了。

二、小周说「你的Agent正在用杀鸡的刀宰牛」

我把这个问题跟小周说了。「我的Agent每次跑完一次完整任务要调五六次模型——感觉自己像个烧钱机器。四毛二一次——我算了算——用户越多我亏得越多。」

「你用的哪个模型?」小周问。

我报了一个名字。是能力比较强的那档——处理复杂任务很稳。

「你拿着它去干什么?」

「判断搜索框在哪儿——还有——」

小周在电话那头笑出了声。那种笑不是嘲笑——是一个工程师看到你拿着火箭筒打蚊子时的本能反应。就像你花了三个月攒了一台顶配电脑——然后用它只开了一个计算器。

「我换个说法你就懂了。你现在手上有一把菜刀和一把手术刀。你切菜用菜刀——剖鱼用手术刀。但你现在是用手术刀在切菜——能切——但刀钝得快还贵。你那把菜刀在哪儿呢?你没买。」

「那该怎么办?」

「把问题分分类。」小周说。「一类是规则能解决的——坐标固定、逻辑确定——用代码写死就行——不花钱。二类是简单判断——按钮位置变了、页面加载超时——需要一点点推理——用便宜的模型就能判断。三类是复杂理解——匹配度计算、开场白生成——这些才值得用贵模型。你现在是把第三类的工具拿来做第一类的事。能不做吗?能。贵不贵?贵。而且是完全没有必要的贵。」

小周的话点醒了我一件事——不是模型太贵——是我用错了地方。

三、拆成两个Agent——「手」和「嘴」

我花了一周把全自动的架构整个重写了。

原来的架构是一个Agent从头跑到尾——遇到任何事情都调大模型——没有任何分级、没有缓存、没有分工。就像一个什么都干的装修工——水电工是他、泥工是他、木工也是他——一个人干所有工种——每个工种都按最高级别的工钱算。

新的架构拆成两个独立的Agent——我管它们叫「手」和「嘴」。

「手」的任务是操作。搜索框在哪儿——它先查坐标规则表——表里存着上一次成功点下去的屏幕坐标。如果坐标点下去之后结果不对——它截一张图——把截图和「我要找搜索框」这个目标一起丢给便宜模型做兜底判断。模型判断出新坐标——存回规则表——下次直接用。日积月累——规则表越用越准——需要兜底的情况越来越少。

「嘴」的任务是判断和生成。这个岗位跟候选人匹配吗——调贵模型。开场白怎么写——调贵模型。HR问了问题怎么回——调贵模型。「嘴」只碰那些真正需要上下文理解和语言生成的任务——不碰任何「现在该点哪儿」「按钮变没变」的问题。

两个Agent之间通过一个非常轻量的状态对象通信。「手」做完一步——把结果写进状态对象——然后告诉「嘴」可以开始。「嘴」读到状态——接着往下做。每一步不需要问「我现在到哪一步了」——状态对象精确记录了执行进度。这个状态对象的引入——直接把模型调用次数降了一半。

重构之后的数据对比非常直观。重构之前——一次全自动任务平均调五次模型——全部用贵模型——单次成本四毛二。重构之后——「手」的部分百分之九十的情况走规则不花钱——百分之十的情况才调模型兜底——而且兜底用的是便宜模型。「嘴」的部分调用次数从五次降到了两到三次——因为不再需要在每一步之前问路了。重构后的单次任务成本——四分六厘。从四毛二降到四分六厘——一分钱不到。节省了百分之八十九。

这个数字让我特别清楚地意识到了一件事:不是模型太贵——是我用错了地方。百分之六十的调用都在问不需要智能的问题——这个比例才是真正的成本黑洞。

四、阿 May 说「你终于学会给人派活了」

「你以前就是一个人干所有的活。」阿 May 听了我的双Agent拆分之后说。「你现在终于知道给不同的人派不同的活了。」

「什么意思?」

「工地上分工是这样的——泥工只负责砌墙——木工只负责支模——钢筋工只负责绑钢筋。每个人只干自己最擅长的那件事。砌墙的不会去绑钢筋——不是因为绑钢筋更难——是让泥工去绑钢筋效率低、出错率高、还浪费他的工钱。你原来那个Agent就是——你让一个绑钢筋的去砌墙——他也能砌——但砌出来是歪的——还花着绑钢筋的工钱。」

「但现在多了一个问题——两个Agent之间怎么配合?」

「工地也有这个问题。」阿 May 说。「泥工砌完一段墙——木工才能来支模。谁通知木工?以前是工长拿着流程单喊——现在是墙上贴一个二维码——扫一下就知道下一步该谁了。你们那个叫什么——握手协议?」

「接口。」我笑了。

「对——接口。你两个Agent之间得有一个『干完了、下一步你上』的信号。泥工撤了木工才上——不能两个人在同一个位置同时干活——会撞。而且工人交接的时候有一个规矩——交枪不交活——你手里的工具可以交给下一个人——但你干的活的质量你自己负责——出了问题找你——不找接手的人。你们那个也得这样——责任边界得清楚——谁出的错找谁。」

阿 May 说的「交枪不交活」后来成了我设计Agent接口时的一个原则。两个Agent之间传递的不只是数据——还有责任。「手」做了错误操作——不能怪「嘴」没判断出来——因为「嘴」不该对「手」的操作负责。反之——「嘴」写了糟糕的开场白——「手」只管发出去——责任在「嘴」。这个责任分割让调试变得非常简单——出错了直接定位到对应的Agent——不需要在两个Agent之间来回猜。

五、坑在哪

坑一:把所有问题都交给同一个模型去判断。这是最贵也最懒的做法。不是所有问题都需要大模型。搜索框在哪儿这种问题——规则解决百分之九十——剩下百分之十才需要模型兜底。做Agent之前先分清楚:规则能干的走规则——便宜模型能干的走便宜模型——真正需要理解的才用贵模型。分得越清楚——成本越可控。

坑二:Agent没有记忆——每次都重新问同样的问题。搜索框坐标问一次就够了——存下来下次直接用。但我的初始设计里Agent每一步都像失忆了一样——不知道自己刚才做了什么——也不知道自己已经知道了什么。加一个简单的状态对象在Agent之间传递——就能省掉百分之六十的调用量。

坑三:模型不分级——贵的便宜的混着用。坐标定位用便宜模型、开场白用贵模型——这才是对的。但我之前是全用一种。用对模型比用强模型重要得多。一个便宜模型在简单任务上可能做到九十五分——贵模型也不过九十八分——便宜模型已经够了。

坑四:只盯着单次调用成本——不看一次完整任务的总成本。四毛二一次看起来不多——但里面百分之六十的钱花在不必要的地方。做AI产品不能只看「调一次模型多少钱」——要看「完成一次用户任务多少钱」——还要看「这个用户任务里有多少钱是可以省掉的」。

坑五:Agent之间没有清晰的责任边界。两个Agent拆开之后——如果没有明确谁对什么负责——出了错就要在两个Agent之间来回排查。谁做的坐标判断——手。谁写的开场白——嘴。这个责任分割必须在架构设计的时候定好——出了事才知道找谁。

坑六:没有考虑规模增长后的成本曲线。四毛二一次在只有几十个用户的时候还能接受——但成本增长是指数级的。做成本优化的时候不能只看当前的用户量——要预判三个月后的用户量。我应该在设计架构的第一天就想清楚——每个用户每次任务花多少钱——用户涨到一千、一万的时候——这个成本结构还能不能撑住。我当时没想——后来账单逼着我想了。

· · ·

六、速查卡

新E10(双Agent分工)「Agent架构为什么要拆?」

他还会这么问:追问——「拆了之后通信成本增加了——你怎么解决?」
他在考什么:面试官想知道你的拆分不是拍脑袋——是真的有实际收益。
结论句:拆的原因不是架构优雅——是成本和出错率。一个Agent什么都干——意味着所有问题都用最贵的模型去解决。
三点口播稿:「我把Agent拆成了两个——『手』和『嘴』。『手』负责执行操作——搜索框在哪儿、按钮在哪儿、页面有没有加载完。这些判断百分之九十走固定规则不花钱——百分之十走便宜模型兜底。『嘴』负责判断和生成——这个岗位配不配、开场白怎么写、HR的问题怎么回。这些才用贵模型。拆之前一次完整任务调五次贵模型——拆之后贵模型调用降到两到三次——规则处理了大部分简单判断。成本从四毛二降到四分六厘——节省了百分之九十。收口:拆分的收益不只是省钱——出错概率降低了、调试难度降低了、替换成本也降低了。将来有更好的『手』模型——换掉手那一半就行——嘴不用动。」
30 秒版:「拆成两个Agent。『手』做执行——规则解决九成便宜模型兜底一成。『嘴』做判断和生成——只用贵模型。拆之前五次贵模型调用——成本四毛二——拆之后两到三次——四分六厘——省百分之九十。将来换模型只换一半。」
数据锚点:单Agent架构:一次完整任务平均调用5次模型——全部贵模型——成本0.42元。双Agent架构:规则处理90%的操作判断——模型调用降到2.3次——成本0.046元。节省89%。出错率从13%降到8%。

新E6(Agent成本)「Agent的成本怎么控制?」

他还会这么问:追问——「你省下来的钱够不够覆盖开发成本?」
他在考什么:面试官想知道你是不是真的算过——不是凭感觉说省钱。
结论句:Agent成本控制的核心不是找更便宜的模型——是减少不必要的模型调用。
三点口播稿:「我做了三件事。第一——任务分级。把Agent要处理的事情分成三类:规则能处理的走规则——不需要钱;简单判断走便宜模型——几分钱一次;复杂理解和生成走贵模型——几毛钱一次。一次完整任务——百分之六十的调用是不必要的——因为那些问题每次答案都一样。第二——上下文缓存。Agent走到哪一步了、已经知道什么信息了——这些不每次重新问——而是由一个结构化的状态对象在Agent之间传递。这个改动把模型调用次数从五次降到了两到三次。第三——失败的代价控制。贵模型调用失败时——不是直接重试——先试便宜模型能不能兜底——不行再升档重试。大部分的失败其实可以被便宜模型处理。收口:成本控制不是一个独立的优化项——它是Agent架构设计的一部分。架构设计的时候就要想清楚哪些信息可以复用——否则后面想加成本控制已经晚了。」
30 秒版:「三件事。任务分级——规则免费、简单判断便宜、复杂才用贵模型。上下文缓存——不让Agent每次重新问。失败代价控制——先试便宜兜底再升档。成本控制不是后面加的——是架构设计的时候就要想清楚的。」

新F6(模型分级)「你的模型分级依据是什么?」

他还会这么问:追问——「你怎么定义『够用』的边界?」
他在考什么:面试官想知道你有没有量化的能力。
结论句:模型分级的依据不是模型的能力排名——是任务对错误率的容忍度。
三点口播稿:「我的分级依据有三个维度。第一——容错率。搜索框定位判断错了——可以重试一次——代价很小。所以这种任务用便宜模型就够了——甚至规则就够了。开场白写错了直接发给HR——社交风险大——必须用贵模型确保质量。容错率越高的任务——越可以用便宜模型。第二——输出结构的复杂度。只需要输出一个坐标的任务——便宜模型就能干。需要输出一段符合特定语气的文字——贵模型。第三——失败成本。定位失败了重试一次多花零点几秒——用户感知不到。但匹配判断失败意味着给用户推荐了不合适的岗位——用户可能因此流失——失败成本高——必须用贵模型保证准确率。收口:模型分级不是为了省钱而省钱——是找到『够用且最便宜』的那个点。给每个任务找最合适的模型——而不只是最强的模型。」
30 秒版:「三个维度。容错率——越能容忍错误的任务越用便宜模型。输出复杂度——简单坐标便宜模型、复杂文本贵模型。失败成本——定位失败重试就行、匹配失败用户可能流失所以用贵模型。不是模型越强越好——是找到够用且最便宜的那个。」

新J4(成本思维)「模型成本怎么随规模上涨?」

他还会这么问:追问——「用户涨十倍——你的模型成本涨几倍?」
他在考什么:面试官想知道你能不能预判成本曲线——而不是等账单来了再震惊。
结论句:模型成本不是线性增长——而是阶梯式增长——因为每次架构优化只能管一阵子。
三点口播稿:「我的成本曲线经历了三个阶段。第一阶段——单Agent全用贵模型。用户不到一百的时候——每个月模型成本几百块——能承受。第二阶段——用户涨到三百——模型成本直接涨到两三千——合四毛二一次。那时候我才意识到——如果不改架构——用户涨到一千月成本就过万了。第三阶段——双Agent分工。成本从四毛二降到四分六厘——降了百分之九十。但这个成本结构能管多久取决于一件事:当用户量再涨十倍——我的规则还能不能覆盖百分之九十的操作。如果页面改版频繁——规则命中率下降——兜底的模型调用就会变多——成本又会慢慢涨上去。收口:AI产品的模型成本不是算一次就完的——它跟用户量、页面稳定性、模型定价都在动态变化。你要做的是让成本结构有继续优化的空间——而不是找到一次最优解就停在那里。」
30 秒版:「三个阶段。用户不到一百——几百块。用户涨到三百——两三千——四毛二一次。双Agent后四分六厘——降百分之九十。但页面改版多了规则命中率下降——成本会再涨。不是算一次就完——是动态的——必须有继续优化的空间。」

· · ·

七、这一章我真正学会的那一招

四毛二降到四分六厘——省了百分之九十。但我觉得最大的收获不是省钱本身——是意识到一个更本质的问题:很多问题不需要聪明答案——只需要对的答案。搜索框在哪儿——这个问题不需要一个有创造力的模型来回答——它只需要一个坐标。我之前犯的错误是——凡是遇到问题——第一反应就是「调模型」。我默认了模型是唯一的解题工具——却忘了还有规则、有缓存、有便宜模型——这些工具大多数时候比贵模型更有效。

便利贴又更新了。在「信任梯子」下面我加了一行:「双Agent——手走规则、嘴走模型。不是所有问题都值得用最聪明的模型去回答——有些问题只需要一个坐标。规则能干的走规则——便宜模型能干的走便宜模型——只有真正需要理解的任务才用贵模型。」

「不是模型太贵——是我用错了地方。百分之六十的模型调用都在问不需要智能的问题。Agent拆分的本质不是分工——是让模型只做模型该做的事。」

【掉落】双Agent分工:手走规则——嘴走模型。不是所有问题都值得用最强的模型去回答。规则能干的走规则——便宜模型能干的走便宜模型——只有真正需要理解的任务才用贵模型。成本从四毛二降到四分六厘——省了百分之九十。不是模型太贵——是用错了地方。

补遗 · Agent 工程与成本(8 题)

数据标注质量成本平衡

① 怎么答:设计:①标注分层——按「标注难度+风险」分层:简单任务(分类/清洗)→ 规则+自动标注(便宜);复杂任务(主观判断/领域知识)→ 人工标注(贵);②质量机制——多人标注+一致性校验(同一任务两人标:不一致的进复核——一致性率是质量仪表盘)、抽检(按比例抽检标注结果:抽检错误率超阈值→返工/换人);③工具提效——预标注(模型先标,人工改——标注成本降 50%+)、快捷操作(快捷键/批量操作);④流程闭环——标注质量问题反馈到标注规范(规范迭代:常见分歧写成规则——标注规范是活的)。成本模型:质量成本 = 返工成本 + 错误下游成本——「省标注钱」如果导致「模型返工」是亏的——质量投入按「错误代价」定(高风险场景多花钱保质量)。

多 Agent 编排路由

① 怎么答:路由设计:①任务画像——每个进来的任务先分类(意图/领域/复杂度——「客服问题」vs「数据分析」vs「代码任务」);②能力注册——每个 Agent 注册「能力卡片」(能做什么、输入输出、成本、置信度)——路由的前提是「知道谁有什么本事」;③路由策略——静态路由(规则/分类模型按任务类型直达指定 Agent——简单稳定);动态路由(路由 Agent 智能选择:综合能力/成本/当前负载——灵活但多一次调用+可能选错);混合(常用任务走静态直达,长尾走动态——成本与灵活平衡);④降级与容错——Agent 执行失败:重试/换 Agent/转人工(路由要带「失败路径」);⑤观测——路由日志(谁选了谁、为什么、结果如何——路由决策本身要可审计可优化)。

多 Agent 搜索优势

① 怎么答:单 Agent 搜索的问题:一个 Agent 既要理解问题、又要拆搜索词、又要逐条检索、又要综合答案——长链路全压在一个上下文里:步骤多了上下文乱(检索结果塞满窗口)、串行慢(一次查一个)、出错率高(一步错全错)。多 Agent 搜索(MindSearch 式)的分工:规划 Agent(拆解问题→生成搜索计划:查什么、查几次);检索 Agent 组(并行执行:多 Agent 同时查不同子问题/不同来源——并行速度快 N 倍);综合 Agent(汇总各路结果→组织答案——只拿汇总的干净上下文);调度 Agent(协调进度、处理失败)。优势:①并行(时间快);②上下文隔离(每个 Agent 只处理自己的部分——不互相污染);③专业化(检索 Agent 专注找、综合 Agent 专注写——每步质量更高);④可观测(哪步出问题定位到具体 Agent)。代价:调用次数多(成本高)——适合复杂问题,简单问题单 Agent 就够了。

AI 识病边缘部署

① 怎么答:边缘端部署:①模型轻量化——识别模型蒸馏/量化到端侧可跑(手机 CPU 能推理:模型 <50MB);②「端+云」分级——端侧小模型处理常见病害(覆盖 80% 场景:常见病识别准、响应快、离线可用——田间没信号也能用);疑难样本(低置信度)→ 云端大模型兜底(有网时自动上传——准确率靠「分级」平衡);③成本——端侧推理免费(不烧 API 费:高频场景成本可控);农户门槛——「拍照即用」:打开 App 对着叶子拍→自动识别+防治建议(大字/语音播报——农户可能不识字);离线优先(田间网络差——核心功能必须离线可用);方言/简单语言。平衡逻辑:端侧保「可用」(快+离线+便宜),云端保「准确」(疑难样本)——用户感知的是「拍了就有答案」。

记忆保留策略

① 怎么答:核心:记忆不是「越多越好」——每多 10KB 多 300ms(用户可感知!)——保留策略按「信息价值密度」取舍:①分级保留——短期(最近 3-5 轮原文:对话连续性必需)、中期(关键信息摘要:用户偏好/已确认事项——压缩成摘要存)、长期(结构化画像:用户资料/重要事实——查表注入);②取舍标准——每条信息问「丢了会怎样」:影响后续对话质量(用户偏好、任务进度——保留);无关细节(闲聊内容——不保留);③预算管理——总预算封顶(如 30KB:3 次 300ms 的延迟是可接受的——超出就「压缩+淘汰」:旧的摘要合并(多个小摘要合成大摘要)、过期信息删除(任务已完成的状态);④按场景调——延迟敏感场景(实时对话)预算小、延迟不敏感(离线任务)预算大。收口:保留策略 = 用「信息价值排序」做内存管理——像人一样:重要的记住,不重要的忘掉。

推理成本四招

① 怎么答:四招分别怎么用:①量化(INT8/FP16)——把模型参数精度降低:显存减半+推理加速(精度略降)——适合「部署层无脑优化」(模型不变,成本直接降 30-50%);②蒸馏——大模型教小模型:训练一个小模型模拟大模型输出——「换引擎」:推理成本降一个量级(但效果略降)——适合「任务固定」(不需要大模型的通用能力);③MoE(混合专家)——模型内部按 token 激活部分专家(不用全量参数):「模型大但每次只用一部分」——效果接近全量、成本接近小模型——适合「底座选型」(选 MoE 架构模型);④模型路由——请求分级:简单问题→小模型(80% 的流量走便宜通道)、复杂问题→大模型(20% 的流量走贵通道)——「总成本 = 便宜×80% + 贵×20%」——组合拳性价比最高。落地顺序:先路由(最快见效)→ 量化(部署层)→ 蒸馏(长期)。

法律合规平台

① 怎么答:四个模块:①法规自动匹配——法规库结构化(法律/法规/部门规章分层+条文编号+时效状态:失效自动标记)→ 输入案情→检索相关法规条文(向量+关键词混合检索——召回相关法条)→ 匹配度标注;②判例检索——判例库(裁判文书)→ 相似案例检索(按案由/争议焦点/裁判结果向量检索)→ 输出「类似判例+结果统计」(胜诉率/赔偿区间);③多 Agent 协同——事实抽取 Agent(从案情提取要素:时间/主体/争议点)→ 法规匹配 Agent(要素→相关法条)→ 推理 Agent(综合法规+判例给出分析结论)→ 校验 Agent(复核引用准确性——法律场景引用错了是事故:校验 Agent 必须有);④私有化交付——律所/法院数据敏感:私有化部署(模型+数据都在内网)、数据分级(案件数据不出域、模型定期安全升级)、审计留痕(推理过程可追溯——法律 AI 的结论必须「可回查」)。

记忆保留追问版

① 追问预案:面试官追加:「300ms 很多吗?」——答:看场景:实时对话(用户等着)300ms 可感知(对话流畅度阈值 ~1s——加 300ms 可能就是「卡」和「不卡」的差别);离线任务无感——所以预算按场景分:实时场景记忆预算小(宁可忘也不能卡)、离线场景预算大;再追加:「你怎么知道哪条信息重要」——答:不靠模型判断(判断不准+要额外成本)——靠「信息类型规则」:任务相关(进度/上下文)必留、用户显式表达(「我喜欢X」「帮我记住X」)必留、其他按时间淘汰(LRU 思想:最近用的留,久不用的压缩);最后追加:「压缩会不会丢信息」——答:会,所以压缩只用于「低价值信息」(闲聊),高价值信息(用户偏好)走结构化存储(不压缩——查表原样取用)。

← 上一章☰ 目录下一章 →
📝 我的备忘录

不认识的蓝色词、不会答的紫色题,点一下就收进来。
两类分开存:词是拿来查的,题是拿来练的。
📌 正文点一下任意一段,或点词/题弹卡里的「先放着」= 暂存待看。

💬 不懂就问
备忘录管存(收藏不会的词和题),这里管问——复制书上任何看不懂的字句粘贴进来,它用大白话讲给你听。
提问后关掉面板也能继续跑,答完了右下角💬会亮红点提醒你。
你好呀,我是你的面试陪练老师👋

书里哪句话看不懂、哪个词不认识、哪道题不知道怎么答,直接粘贴进来问我。我会用大白话讲,讲完还会告诉你怎么在面试里用。

举个例子:粘贴「RAG是检索增强生成…」,问:这句话是什么意思?面试官为什么问这个?
🎤 语音面试
点击🎤开始语音面试
⚙ 设置(AI能力三连 / 我的情况 / 同步)
自动模式按 Gemini → GPT → GLM → DeepSeek 顺序自动选可用模型;选中大模型后只走该模型;千问-VL 专用于看图片,无需配置。价格已卡死:所有模型 ≤ 输入2元/输出4元每百万token

AI 每次对话都会带上这段「我的情况」(改完立即生效);留空 = 用默认设定

✅ 永久同步已开启:…
电脑和手机打开同一网址即自动同步,无需绑定
🤖 智能 = 它自己判断:简单问题不思考直接答;问天气/新闻/行情自动联网;闲聊日常自动切日常口吻。
🗂 对话记录