PLAIN-LANGUAGE CONCEPT ATLAS

📖 FDE 概念图鉴 · 大白话版

网站里那些术语,这里一个个说人话。每个概念 = 一句大白话 + 生活类比 + 真实公司/事件的故事 + 为什么重要。由 20 个 agent 按概念域并行编写,覆盖 32 域、183 个概念。下方可直接搜词或按域筛选。

说明:「真实案例」由 20 个 sonnet agent 结合公开知识编写,力求真实;涉及具体估值/百分比之处,请以各页「🔗 延伸阅读」里的官方来源为准。这一页的目标是让你秒懂概念,不是替代权威数据。
183
概念词条
32
概念域
20
编写 agent
4
维度/词条
显示 183 个概念

FDE 角色的本质与起源 · 6 个概念

Forward Deployed Engineer(前向部署工程师,FDE)
一种直接住在客户那里办公、边写代码边解决客户真实问题的工程师,不坐在总部等需求文档。
就像装修队里有个师傅专门驻场在你家,你说「这堵墙我不想要了」,他当场量尺寸、立刻动手拆,而不是回公司开三次会再排期。
真实案例Palantir 是把 FDE 这个角色发扬光大的公司。他们做政府和军队的大数据分析,但政府客户说不清楚自己要什么,Palantir 就派工程师住进五角大楼或中情局,跟分析师并排坐、看他们怎么工作,然后当场改软件。据报道 Palantir 早期几乎每个重要政府客户都有专属驻场团队,这套打法帮他们把合同一签就是多年。
为什么重要解决了「客户不会写需求,产品团队不懂业务」这个双向信息断层——FDE 就是那座桥。
FDSE(Forward Deployed Software Engineer,前向部署软件工程师)
FDE 的另一种叫法,强调他的本职是写代码,而不只是沟通或咨询,他既是工程师又是客户的临时队友。
就像外卖平台派了一个既会做菜又会送餐的人到你家,他能根据你冰箱里现有的食材现场给你做一顿,而不只是把固定套餐送到门口。
真实案例AI 公司 Sierra(由前 Salesforce 联席 CEO Bret Taylor 创立)大量使用 FDSE 模式帮企业落地对话式 AI Agent。他们的 FDSE 会进入客户的客服部门,观察真实工单、看客服怎么处理投诉,然后现场调整 Agent 的回复逻辑和工具调用链,直到 Agent 能真正替代人工处理常见问题。这比远程交付产品再等反馈,快了好几个月。
为什么重要纯产品交付常常「功能上线但没人会用」,FDSE 的存在就是确保代码落地的那一公里真的被打通。
Palantir 的 Delta 工程师
Palantir 内部专门负责冲进去给客户现场搭建、调试、改装软件的那批工程师,是 FDE 概念的最早原型和代名词。
就像消防队里的突击小组,不在消防站坐班,专门被派去火灾现场第一时间处置,事情解决了再撤。
真实案例Palantir 早年把工程师分成「Platform」和「Forward Deployed(当时内部也叫 Delta)」两类。Delta 工程师被派往美军、英国国家医疗体系(NHS)等客户现场,在真实数据环境里搭 Palantir Gotham 和 Foundry 的工作流。据 Palantir 前员工描述,他们有时要在客户机房里通宵调试,第二天直接跟将军或高管汇报成果。这套模式让 Palantir 在不透明的政府采购市场里建立了极深的护城河。
为什么重要证明了「把最好的工程师送到离问题最近的地方」比「在总部做一个通用产品」更能打赢企业级市场。
驻场 / 嵌入客户(On-site Embedding)
供应商或服务商的工程师不在自己公司上班,而是长期在客户的办公室里办公,和客户团队混在一起工作。
就像你家装修时水电工不是上午来下午走,而是整个装修期都住在你家小区,随叫随到,哪里漏水当场修。
真实案例麦肯锡、埃森哲做咨询时早就有驻场顾问的传统,但 AI 时代这个模式被科技公司发扬光大。据报道,Glean(企业知识搜索 AI)在拓展大客户时,会派技术团队驻场数周,帮客户连接内部 Confluence、Slack、Salesforce 等数十个数据源,调试权限和搜索质量。没有这段驻场期,客户的 IT 部门根本不知道怎么开放正确的 API 接口。
为什么重要很多企业软件失败不是因为产品不好,而是因为「最后一公里」没人负责;驻场就是专门做这件事的。
「产品发现」型工程师(Product Discovery Engineer)
一种工程师,他的主要工作不是按照写好的设计图做功能,而是和客户一起「挖掘」出真正需要做什么,边探索边造。
就像你去找中医,你说「我最近不舒服」,中医会问你一堆问题、把脉、观察,然后才开方子——而不是你一进门就给你一盒固定的药。
真实案例Harvey(面向律师事务所的 AI 工具)在早期落地时,工程师并没有拿着现成的「合同审查功能」去卖,而是派人进驻 Allen & Overy 等律所,坐在律师旁边看他们怎么做尽职调查、哪些环节最耗时。这段「发现期」持续了数月,最终帮助 Harvey 确定了真正有价值的工作流,而不是做一堆律师不会用的功能。据报道 Harvey 2023 年完成约 2100 万美元 A 轮时,这种深度客户共创已经成为他们的核心竞争力。
为什么重要客户很少能直接说清楚自己要什么,「产品发现」型工程师存在的意义就是把隐性需求变成真实可用的产品。
技术客户成功工程师(Technical Customer Success Engineer,TCSE)
专门在客户买了产品之后跟进使用、帮客户真正用好软件的工程师,介于售后服务和技术顾问之间。
就像买了高档烤箱后,品牌方派一个大厨来你家,手把手教你用,并且根据你家的燃气和习惯调整烤箱参数,确保你真的能烤出好菜而不是买了闲置。
真实案例科大讯飞把语音 AI 卖给医院、学校时,不只是给一个 SDK 了事,而是派工程师进驻帮客户定制词库、优化识别准确率。据讯飞官方介绍,他们在智慧医疗方向为多家医院提供长达数月的驻场实施支持,把电子病历语音录入的准确率从通用模型的约 85% 提升到行业术语场景下的 95% 以上。这种配套服务最终变成他们和客户签长期服务协议的筹码。
为什么重要SaaS 时代最大的流失原因不是产品差,而是客户「买了不会用」或「用了没看到效果」;TCSE 就是专门对付这个问题的。

FDE 商业模式 · 4 个概念

嵌入式交付 Embedded Delivery
AI/软件公司不只给你一个工具,而是派出自己的人常驻在你公司里,帮你把产品真正跑起来、用起来。
就像你家装修,不是买一堆建材扔门口就走,而是工长带队住在工地,每天跟你对需求、返工、收尾,直到你真的能住进去。
真实案例Palantir 是这个模式的标志性玩家。他们卖数据分析平台的同时,会派出「前沿部署工程师(FDE)」长期驻扎在客户(军队、医院、大型车企)内部,有时一待就是一两年。据报道他们早期政府客户的交付团队规模有时超过客户自己的 IT 部门,靠这个模式啃下了不少竞争对手拿不下来的超大单。
为什么重要纯卖软件授权,客户往往买了不会用、用了没效果;嵌入式交付把「产品能不能真的跑出价值」这件事,从客户的责任变成了供应商的责任。
产品发现 Discovery Sprint
在真正动手做产品之前,用几天到几周时间快速弄清楚「到底要做什么、值不值得做」,避免写了几个月代码才发现方向全错。
就像你想开一家奶茶店,先别急着签租约装修,先花一周在目标地段摆个摊、问问路人口味、算算成本,验证完再砸钱。
真实案例谷歌的 Google Ventures(GV)把一套叫「Design Sprint」的五天产品发现流程发扬光大,后来写成了《Sprint》这本书。据报道,Slack 早期也用类似的快速验证方法,在大规模开发之前反复测试「人们愿不愿意在工作中用聊天室替代邮件」这个核心假设,才逐步确定了产品形态。
为什么重要软件开发最贵的错误不是代码写错,而是方向搞错——Discovery Sprint 的意义就是让你花小钱排大雷。
按结果计费 Outcome-based Pricing
不按「做了多少工时/卖了多少席位」收钱,而是你帮客户真正赚到钱或省到钱了,才按比例分成或收费。
就像找律师打官司,不收固定律师费,赢了才按赔偿金额抽一定比例——这样律师和你利益完全一致,他会拼命打,而不是拖时间计小时费。
真实案例AI 法律公司 Harvey 据报道在部分大客户合同中引入了与「律师工时节省量」挂钩的定价机制;医疗 AI 公司 Viz.ai 在美国医院推广脑卒中识别工具时,也采用了按「成功识别并加速治疗的病例数」计费的模式,而非卖固定订阅,这让医院更愿意试用。
为什么重要传统软件卖席位,客户不用也要付钱,双方目标不一致;按结果计费让供应商只有真正帮客户赢了才能赚钱,倒逼质量。
产品化服务 Productized Services
把原本每次都要从头定制的咨询/服务,打包成一个固定范围、固定价格、固定交付物的「产品」,像买商品一样下单就走。
就像麦当劳套餐——不是每次进去跟厨师谈「我要什么食材搭什么酱汁」,而是1号套餐、2号套餐,清单明确、价格透明、出餐时间固定。
真实案例AI 咨询公司 Turing 和一批 FDE 工作室开始把「60 天 AI 试点落地包」做成固定产品:明确交付一套数据管道+一个可演示的 demo+一份汇报材料,打包定价,不谈工时。国内智谱 AI 也在推类似的「行业大模型快速接入套餐」,帮中小企业绕开漫长定制谈判,几周内跑通第一个场景。
为什么重要纯定制服务难以规模化,每单都要重新谈、重新做;产品化之后可以复制、可以提前定价、可以让初级成员执行,公司才能真正长大。

FDE 增长与客户经营 · 5 个概念

Land & Expand 登陆扩展
先用最小单元把产品卖进一家公司,站稳脚跟后再逐步扩大使用规模、赚更多钱。
就像一家新餐馆先在某写字楼的一楼开小窗口卖外卖,等周边员工都吃习惯了,再把整层楼的团餐合同拿下来。
真实案例Slack 当年就是这么打进企业的——一个团队先免费试用,用爽了就自发拉其他部门一起用,最后公司整体付费采购。据报道 Slack 上市前有高达 40% 的付费客户来自这种内部自发扩散,而不是销售主动推销出去的。
为什么重要它解决了「大客户难敲门」的问题:与其一开始就谈几百万合同吓跑对方,不如先用小单子建立信任,让产品价值说话。
NRR 净收入留存率
把老客户上一年交的钱和今年交的钱一对比,看老客户整体是给你花更多了还是走掉了一部分,结果大于100%说明靠老客户就能自己长。
就像你开一家健身房,去年的会员今年续卡之余还把朋友带来办卡,今年从这批老面孔身上赚的钱比去年多了,这个比值就是 NRR。
真实案例Snowflake(美国云数据仓库公司)在上市前曾公布其 NRR 超过 158%,意思是老客户每花出 1 块钱,第二年就变成了 1.58 块,完全不靠新客户公司也能高速增长。这个数字当时震惊了整个投资圈,也是它上市时创下软件公司 IPO 纪录的重要原因之一。
为什么重要它是衡量一家 B2B 软件公司健康程度最核心的体检指标——NRR 超过 100% 意味着老客户自己就能推着公司往前跑,而不是靠不断拉新来堵窟窿。
ACV 年度合同价值
一份客户合同摊到每一年值多少钱,不管合同期是两年还是五年,只算一年的份额。
就像你租了一套房子签了三年租约,房东不说「这个租客总共给我 18 万」,而是说「这个租客每年给我 6 万」,ACV 就是这个「每年 6 万」。
真实案例Salesforce 是最早把 ACV 当核心销售指标的 CRM 公司之一。它的销售团队用 ACV 来考核业绩、拆分大单目标,一笔五年 500 万的合同在内部汇报时就是「ACV 100 万」。这让不同合同期的客户可以被放在同一把尺子下比较,销售资源也因此能按年度价值高低来合理分配。
为什么重要它解决了「合同大小没法横向比较」的混乱——签了一堆期限不同的单子,只有折算成年度价值才知道公司每年真正能进多少钱。
LTV 客户终身价值
一个客户从第一次付钱到彻底离开,这辈子总共能给你带来多少钱。
就像开一家理发店,有个客户从 20 岁剪到 50 岁,每个月来一次,他这 30 年贡献的总消费就是他对你这家店的「终身价值」。
真实案例据业界广泛引用的研究,Amazon Prime 会员的 LTV 约是非会员的 4 倍以上,这也是亚马逊愿意把会员服务定价压得极低甚至亏本的核心逻辑——他们算的不是今天这笔钱,而是这个会员未来十年会在亚马逊上消费多少。Harvey(AI 法律助手)这类新兴企业 SaaS 也在用同样的思路:头几个月可以让大律所低价试用,因为一旦用深了,未来几年的合同金额远超这点优惠。
为什么重要它让你知道值不值得花大钱去拉一个新客户——如果一个客户终身能带来 5 万块,花 5000 块去获客就很划算,但如果只能带来 3000 块,那就是在亏钱做生意。
客户成功 Customer Success
卖出去之后专门有一批人跟着你,保证你真的把产品用起来、用出效果,而不是买了就放在那里吃灰。
就像你买了一台高端跑步机,商家不只是送货,还派了个私教定期上门检查你有没有用、教你怎么设定计划、帮你在快放弃的时候劝你坚持——这个私教干的事儿就是「客户成功」。
真实案例Gainsight(客户成功管理软件公司,本身也是这一理念的奠基者之一)在 2010 年代将「Customer Success」从一个模糊的服务概念变成了一个完整的职能部门。Glean(企业 AI 搜索,硅谷估值据报道已超 40 亿美元)的客户成功团队会在大客户签约后的 90 天内密集跟进,确保员工真正用上搜索功能,因为他们知道:用不起来的产品,续约率一定会崩。
为什么重要它解决了「卖出去就完了」的短视——软件可以反复续约,客户用不好就不续,所以确保客户成功本质上就是在保护公司自己的未来收入。

FDE vs 管理咨询 vs SaaS · 5 个概念

管理咨询(麦肯锡式)
花高价雇一群名校毕业生来告诉你公司该怎么做,他们写完报告就走,执行是你的事。
就像去看中医名医,他把脉开方子、收大几千块诊费,但药要你自己抓、自己喝——他不管你喝没喝。
真实案例麦肯锡曾为安然(Enron)提供战略咨询,收取了大量顾问费,帮其设计了多项「创新」业务结构。安然后来因财务造假破产成为史上最大丑闻之一。麦肯锡的报告没有阻止它,但顾问费已早早进账。这个案例让人反思:建议值多少钱、后果由谁承担?
为什么重要它解决的是「企业一把手没时间/没外部视角」的问题,但成果无法保证,这正是 FDE 模式想要超越它的起点。
产品原语(Product Primitive)
把某个能力拆成最小的、可反复组装的零件,像乐高积木一样,别人拿走就能拼出各种产品。
就像外卖平台把「定位+支付+评价+配送」拆成四块积木——你要做一个同城跑腿 App,直接拼进去就行,不用从零造。
真实案例Stripe 把「网上收钱」这件事拆成了几行代码的 API 积木。任何创业公司接入 Stripe,不需要搞懂银行清算,直接用。据报道 Stripe 估值一度超过 950 亿美元,靠的就是把支付做成了人人能复用的原语。Anthropic 的 Claude API 也是同一逻辑——把「会思考的模型」做成原语,让开发者自由组装。
为什么重要解决「重复造轮子」的浪费——有了原语,上层应用可以专注自己独特的价值,而不是每次都从头搭底层。
人天计费
按照「几个人干了几天」来收钱,干的时间越长、人越多,钱收得越多——不管最终结果好不好。
就像装修公司说「我派3个工人来,干10天,一人一天800」——管你最后装出来好不好看,工时钱先给够。
真实案例传统IT集成商和管理咨询公司长期用这套模式。一个大型政府信息化项目,据业内普遍反映,顾问团队可能驻场一两年、账单按人天滚动,项目完工时甲方发现功能还不如预期,但钱已全部结清。这种模式下服务方没有动力提效——做得越慢反而越赚。
为什么重要它暴露了传统服务业最根本的矛盾:卖方的利益(多耗时)和买方的利益(快出结果)天然对立,FDE 要用「按价值/结果付费」来替代它。
价值飞轮(Flywheel)
用户越多→数据越多→产品越好→吸引更多用户,这个正循环一旦转起来,后来者很难追上。
就像一家餐馆,评价多了排名靠前、来的人更多、评价又更多——后开的新店没有这些积累,起步就输了。
真实案例亚马逊的 Jeff Bezos 在 2001 年在餐巾纸上画出了这个循环:更低价格→更多顾客→更多第三方卖家→更大规模→更低成本→更低价格。二十多年后亚马逊市值超过 2 万亿美元,这张餐巾纸被视为商业史上最值钱的涂鸦之一。Glean(企业搜索 AI)也在复制类似逻辑:用的企业越多,搜索结果越准,吸引更多企业。
为什么重要它解释了为什么头部平台越来越难被挑战——不是因为技术有多神,而是那个「滚雪球」的循环本身就是护城河。
技术+关系双重护城河
一家公司同时靠两道防线让对手很难取代它:一道是你学不会的技术,另一道是多年积累的信任和人脉。
就像一个装修老师傅,手艺(技术护城河)没人能一夜学会,而且他跟小区业主认识十几年(关系护城河)——你就算手艺一样好,客户也懒得换人。
真实案例Palantir 是这个逻辑的教科书案例。它把数据分析平台深度嵌入美国政府和军队系统(技术护城河),同时创始人和高管与五角大楼、情报机构高层保持多年私交(关系护城河)。据报道其政府合同续签率极高,竞争对手即便技术相当,也因为缺少那张「关系网」而难以进入。Harvey(法律 AI)也在复制这个路子:产品深嵌律所工作流+合伙人级别的私下信任。
为什么重要单靠技术会被复制,单靠关系会被挖角——两道护城河叠在一起,才能真正让客户「离不开你」。

大模型基础概念 · 6 个概念

LLM 大语言模型
一个用海量文字训练出来的 AI,能读懂你说的话、然后生成像人一样的文字回复。
就像雇了一个从小读了几亿本书的人坐在电脑那头,你问什么它都能接着说下去。
真实案例OpenAI 在 2022 年底发布 ChatGPT,背后就是一个 LLM(GPT-3.5)。上线 5 天就突破 100 万用户,2 个月破亿,成为史上用户增长最快的消费级应用。它能写代码、翻译、总结文件、聊天,这些全是同一个模型做的。
为什么重要以前每个 AI 只能做一件事,LLM 第一次让一个模型能干几乎所有文字相关的活。
Token(词元)
模型处理文字时切出来的最小单元,不是一个字,也不是一个词,是介于两者之间的小块。
就像餐厅收银系统不按「一道菜」计价,而是按「一勺米饭、半片肉、两根菜」这种更小的单位来核算成本。
真实案例用 OpenAI 的 GPT-4 API,每处理约 750 个英文单词(约 1000 个 Token)需要花费若干美分;中文因为每个汉字通常对应 1-2 个 Token,所以处理同等信息量比英文贵一些。Anthropic 在 Claude 的定价页面就直接用 Token 数计费,企业每月账单少则几百美元,多则数万美元,全靠 Token 撑起来。
为什么重要Token 是模型的「算力货币」,决定了用多少算力、花多少钱、能处理多长的文章。
参数量(7B / 70B)
模型里存了多少个可调节的数字,数字越多,模型学到的「知识容量」通常越大,但跑起来也越费资源。
就像厨师的脑子里记了多少道菜谱——记了 70 亿道和记了 700 亿道的厨师,水平和出菜速度差距很大,但后者吃饭也贵得多。
真实案例Meta 开源的 Llama 3 系列有 8B(约 80 亿参数)和 70B 两个版本。8B 版本用一张消费级显卡(如 RTX 4090,24GB 显存)就能跑;70B 版本至少需要两张专业显卡,普通人玩不起。但 70B 在推理、代码等任务上的准确率明显高一截,大公司愿意付这个硬件成本。
为什么重要参数量直接决定了你「能不能在自己电脑上跑这个模型」,是普通开发者选型时最先看的指标。
Context Window 上下文窗口
模型每次处理时,最多能「看见」多长的内容,超出这个长度的部分它就看不到了,像短暂失忆。
就像你雇了个翻译,但他手头只有一张 A4 纸,超过一张纸的内容他根本没见过,所以只能翻当前这页。
真实案例早期 ChatGPT(GPT-3.5)的上下文窗口只有约 4000 个 Token,大概是三四页 Word 文档,稍长一点的合同就塞不进去。Anthropic 把 Claude 的上下文窗口扩到了 20 万 Token(约一本正常厚度的小说),让用户可以把整份合同或一整个代码库丢进去直接分析,这成了 Claude 的核心卖点之一。
为什么重要窗口太小,模型读文章读到一半就「忘了」前面说什么,所以上下文窗口大小直接决定模型能处理多复杂的真实任务。
预训练
在正式「上岗」之前,让模型先把互联网上的海量文字全部读一遍、学会语言规律的那个阶段。
就像新员工入职前先去培训学校待了几年,把行业基础知识全学了一遍,再来上班才能快速上手。
真实案例GPT-4 的预训练据报道使用了约 13 万亿个 Token 的文本数据,训练一次烧掉的算力成本据业界估计超过 1 亿美元。这个阶段让模型学会了语言、常识、代码、数学……之后再用少量数据做「微调」,才变成你用的 ChatGPT 或 Claude。
为什么重要预训练是模型所有能力的「地基」,没有这个阶段,再多的微调也是空中楼阁。
能力涌现 Emergence
模型在参数量或训练量超过某个门槛之后,突然就能干以前完全不会的事,没人事先设计,自己「冒」出来的。
就像你往玻璃杯里一勺一勺加水,加到第 99 勺都没溢出,加第 100 勺突然全淌出来——能力的跨越不是慢慢变好,而是忽然跳级。
真实案例谷歌研究团队在 2022 年发表的论文《Emergent Abilities of Large Language Models》中记录了这个现象:同样的模型架构,参数量较小时完全不会做多步算术推理,但当参数量超过某个规模,这个能力几乎是「一夜之间」出现的,准确率从接近 0 直接跳到可用水平,没有过渡期。
为什么重要涌现意味着更大的模型可能突然拥有谁都没预料到的新能力,这既是 AI 让人兴奋的原因,也是让研究者担忧失控风险的核心来源。

提示词与幻觉 · 6 个概念

提示词 Prompt
你给 AI 下的命令或问题,就是你输入的那段话——AI 的输出好不好,全看你这段话写得行不行。
就像你去餐厅点菜,说「随便来一份」和「来一份微辣不放香菜的宫保鸡丁」,端上来的东西天差地别。
真实案例OpenAI 发现,同样是 GPT-4,用「你是一位有20年经验的律师,请逐条分析以下合同风险」比直接丢合同文本,生成质量差距极大。专门研究怎么写这段话的岗位因此诞生,行业里称为「提示词工程师」,据报道2023年前后部分岗位年薪开到15万美元以上。
为什么重要AI 模型本身没变,但提示词写法能让结果从一塌糊涂变成专业可用——它是人和 AI 之间最直接的沟通界面。
幻觉 Hallucination
AI 一本正经地编出根本不存在的事实、数字或引用,听起来很真,但是假的。
就像一个实习生为了不让你失望,把他不知道的答案也煞有介事地「答」出来,还附上一个查无此书的参考文献。
真实案例2023年美国律师史蒂文·施瓦茨用 ChatGPT 写法庭简报,AI 捏造了6个根本不存在的判例,连案号都编得有模有样。他把这份文件提交法院后被法官识破,最终被罚款5000美元并公开道歉。这个案子让全球法律界意识到 AI 幻觉不是小毛病。
为什么重要幻觉是 AI 落地最危险的陷阱之一——用户越信任 AI,越容易被假答案误导,尤其在医疗、法律、金融这些高风险场景里后果严重。
上下文学习 In-context Learning
不用重新训练模型,只靠在对话框里给几个例子,AI 就能学会你想要的新任务和新格式。
就像你临时教新员工做事,不用让他去培训班,你直接给他看三份你以前做好的样品,他就明白你要什么风格了。
真实案例Notion AI 上线时,官方演示了一个场景:在提示词里贴上两三条公司内部的会议记录示例,再让 AI 生成同格式的摘要,模型完全不需要针对这家公司重新训练,直接照着样本输出了对应风格。这种「例子即教材」的用法,让中小企业不花一分钱训练成本就能定制 AI 行为。
为什么重要它打破了「要让 AI 做新事就必须花大钱重新训练」的误区,让普通用户也能临时调教模型去干特定的活。
思维链 Chain-of-Thought(CoT)
让 AI 在给出答案之前,先把推理步骤一步步写出来,这样答案更准,错误也更容易被发现。
就像你让一个学生做数学题,要求他把草稿步骤全写出来,而不是只交答案——有了过程,你能看出他哪里想歪了。
真实案例谷歌研究团队2022年发表论文,发现只要在提示词末尾加上「让我们一步步思考」(Let's think step by step),GPT-3在数学推理题上的正确率从约18%跳升到约79%。就这一句话,不改模型,不加训练,准确率翻了四倍多。这篇论文随后被引用超过万次,成为提示词工程领域引用最多的工作之一。
为什么重要AI 直接跳答案时容易出错,逼它「说出思考过程」能大幅降低推理失误,复杂任务的可靠性因此实质性提升。
少样本学习 Few-shot
在问 AI 问题之前,先给它看几个「问题+正确答案」的配对例子,AI 就能照着模式来回答你真正的问题。
就像你让邻居帮你翻译文件,先给他看三份你翻好的样板,他一下子就懂了你要什么文风和格式,不用再啰嗦解释。
真实案例Harvey 是一家专门为律师事务所做 AI 的公司,据报道其产品里大量使用少样本技术:在提示词里内置几份真实合同的修改范例,让模型学会该律所特定的措辞风格和审查标准,而不是输出通用模板。Allen & Overy(现 A&O Shearman)是其早期客户之一,据报道内部测试后认为在合同审查效率上有显著提升。
为什么重要它是让通用 AI 快速适应特定行业或公司口味的最低成本方案,不需要收集海量数据,给几个精心挑选的例子就够了。
检索增强生成 RAG
让 AI 在回答前先去查一份你指定的资料库,把查到的内容拼进答案里,而不是全靠它自己记忆里的知识。
就像考试允许带小抄本——AI 不再靠死记硬背,而是现查现用,答案来源有据可查。
真实案例Glean 是一家企业搜索 AI 公司,其核心产品就是 RAG 架构:员工提问时,系统先实时检索公司内部的 Slack、Confluence、Google Drive 等文档,再把相关片段喂给大模型生成答案。这样 AI 说的是公司自己的最新信息,而不是训练时学到的过期通用知识。据报道 Glean 估值已超过45亿美元,RAG 是其核心技术卖点。
为什么重要RAG 是解决 AI 幻觉和知识过时这两个最头疼问题的主流方案,让 AI 的输出有了可以核查的来源。

RAG 检索增强生成 · 6 个概念

RAG 检索增强生成(Retrieval-Augmented Generation)
让 AI 在回答之前先去你自己的资料库里查一遍,用查到的内容来回答,而不是靠自己脑子里背的东西瞎编。
就像开卷考试——题目来了先翻书,翻到相关段落再写答案,比闭卷死记硬背准多了。
真实案例客服 AI 公司 Sierra 给企业部署的智能客服,核心就是 RAG:用户问「我的订单能退款吗」,AI 先去查该公司的退款政策文档,再用文档里的原话来回答,而不是凭空猜测。据报道 Sierra 服务的客户退款处理时效从数天压缩到分钟级,出错率也大幅下降。
为什么重要解决了 AI「幻觉」问题——不让它靠记忆编答案,而是逼它先查文件再开口,答案更可信、更新、更贴你的业务实际。
Embedding 向量化
把一段文字变成一串数字(几百个),意思相近的文字,数字也相近,让机器能比较「语意有多像」。
就像给每道菜打一张「口味坐标卡」——辣度8、油腻度3、酸度2……两道菜坐标越接近,味道就越像,哪怕菜名完全不同。
真实案例OpenAI 的 Embedding 接口(text-embedding-ada-002 及后续版本)是目前全球调用量最大的向量化服务之一,开发者把合同、FAQ、产品说明丢进去,每段文字都变成 1536 维的数字串,储存起来供后续检索。国内智谱 AI(GLM 系列)也提供类似 Embedding 接口,被大量法律科技、金融科技公司用于合同语义匹配。
为什么重要有了这串数字,机器才能做「意思比较」而不只是「关键词匹配」——你问「如何退货」,也能匹配到写着「申请售后」的条款。
向量数据库
专门用来存那堆数字(向量)、并且能超快找出「最相近的几条」的数据库,普通 MySQL 做不了这件事。
就像图书馆里有个按「内容相似度」排列的书架——你说「我想找讲投资风险的」,它直接把最相关的十本书推到你面前,不用你一本本翻标题。
真实案例Pinecone 是这个赛道最早商业化的公司之一,据报道其客户覆盖超过 1 万个开发团队,存储了数十亿条向量。国内的 Milvus(开源,由 Zilliz 商业化)也被科大讯飞、百度等大厂用于大规模语义检索。2023 年 AI 热潮带动这类数据库融资额集体暴涨,Zilliz 单轮融资超过 6000 万美元。
为什么重要没有它,AI 每次回答前都得把几百万段文字全比较一遍,慢到没法用;向量数据库让这个查询在毫秒内完成。
语义检索
按照「意思是否相近」来搜,而不是靠「字面完全一样」来搜——你不用猜对关键词,说清楚你要什么就行。
就像跟聪明的老员工要资料——你说「找一下上次那个客户投诉处理的案子」,他明白你意思直接找来,不会因为你没说「投诉受理记录 2024Q3」就找不到。
真实案例企业搜索工具 Glean(估值据报道超过 22 亿美元)的核心卖点就是语义检索:员工在 Slack、Confluence、Google Drive 里找东西,输入「上个季度和 Acme 客户谈过的折扣条件」,哪怕文件里写的是「定价协商备忘录」,Glean 也能找出来,而旧的关键词搜索直接返回零结果。
为什么重要传统关键词搜索要求你猜对作者用了哪个词,语义检索让你说人话,大幅降低「明明有这份文件却搜不到」的情况。
企业知识库问答
把公司内部的文档、手册、历史记录喂给 AI,让员工或客户能直接用对话方式问问题,AI 从这些文档里找答案。
就像给公司雇了一个读完所有内部资料的全知老员工,任何人来问「这个流程怎么走」「这个合同条款是什么意思」,他都能当场答出来,还能说「出处在第 47 页」。
真实案例法律 AI 公司 Harvey(获 a16z 等投资,估值据报道约 15 亿美元)为律所搭建的就是这套系统:把几十年的判例、内部备忘录、客户档案都导入,律师用自然语言提问,系统在秒级内从数万页文件里找出相关段落并生成摘要,据报道合同审阅效率提升约 10 倍。
为什么重要公司的真正价值往往锁在文档里,但员工根本没时间全读完;这套系统让知识「活」起来,不再因为人走茶凉或文件太多而流失。
分块(Chunking)
把一篇长文档切成一段段小片,每段单独存储和检索,因为 AI 一次只能「看」有限的内容。
就像做便利贴——与其把一本合同拍一张大照片,不如把每个条款单独抄一张便利贴,用的时候只抽出相关那几张,省事又准确。
真实案例Anthropic 在其官方 RAG 技术博客中明确指出,切分粒度直接决定检索质量:太长容易带入噪音,太短又可能丢失上下文。月之暗面(Kimi)的长文理解产品在内部处理超长 PDF 时,也通过动态分块来平衡检索精度与速度,支持最长约 200 万字的文件上传。
为什么重要不切分就存整篇,检索时要么什么都拿出来要么什么都拿不准;合理切分是让 RAG 准确的最基础一步,很多系统效果差就差在这里。

RAG 工程细节 · 5 个概念

分块 Chunking
把一大篇文章切成一小段一小段,让AI每次只看一小块,方便检索和理解。
就像把一本菜谱剪成一张张卡片,每张只写一道菜,要找「红烧肉」时不用翻整本书,直接抽那张卡就行。
真实案例企业知识库平台 Glean 在帮客户搭内部搜索时,曾公开分享过他们的踩坑经历:把一份几十页的合同当成一整块喂给向量模型,结果AI每次回答都答非所问,因为模型根本「看不过来」。后来改成按段落切,每块约300-500字,检索准确率明显提升。国内不少基于文档问答的产品也发现,块切太大上下文稀释、切太小缺乏语境,需要反复调参。
为什么重要文档太长AI抓不住重点,分块是让AI「有的放矢」的第一步,切得好不好直接决定后续检索质量。
重排 Rerank
先用快方法大范围捞出一批候选结果,再用更精准的方法把这批结果重新排一遍,把最相关的放最前面。
就像外卖平台先筛出附近50家餐厅,再根据你的口味偏好、评分、上次点的记录,重新排出前5名推给你,而不是把50家都甩你脸上。
真实案例AI搜索公司 Cohere 专门做了一个叫 Rerank 的独立API,被很多企业搭进自己的RAG流水线。Harvey(面向律所的AI助手)在处理案件检索时,初步召回可能返回数十条法律文件片段,再经过Rerank按照与问题的语义相关性重新排序,律师拿到的第一条结果才真正有用。据报道这一步能把最终回答质量明显提升。
为什么重要初步检索求快求全,难免夹带不相关内容;Rerank是「质检员」,让最终给AI的上下文真正有价值,减少废话干扰。
混合检索 Hybrid Search
同时用「关键词匹配」和「语义理解」两种方式找资料,然后把两边的结果合并,比单用一种更准。
就像找装修师傅,既在招聘网站搜「南京 贴瓷砖」(关键词精确),又让熟人按你的需求推荐「靠谱、细心、能沟通的」(语义理解),两边都问,候选人才不会漏。
真实案例Elasticsearch 在8.0版本后把向量检索和传统BM25关键词检索合并进同一个引擎,企业不用再搭两套系统。国内智谱AI的知识库产品也采用类似方案:纯语义检索容易漏掉含有特定产品型号、法规编号等精确词的文档,加入关键词检索后召回率明显改善。业界普遍认为混合检索是当前RAG工程的标配做法。
为什么重要纯语义检索遇到专有名词、编号、缩写容易抓瞎;纯关键词又不理解同义词;混合才能两头都不漏。
召回率 / 精确率
召回率是「该找到的有没有找到」,精确率是「找到的里面有多少是真正有用的」,两个指标一起才能衡量检索质量。
就像用网捕鱼:撒大网捞上来的鱼里没漏掉目标鱼,叫召回率高;捞上来的里面目标鱼多、杂鱼少,叫精确率高。大网捞得全但杂鱼多,小网干净但容易漏鱼,怎么平衡是关键。
真实案例Palantir 给医疗客户做AI文档检索系统时,遇到的真实问题是:召回率调高,医生会被一堆不相关病历淹没;精确率调高,关键诊断记录又可能漏掉。最终他们在评估阶段专门建了测评集,用F1分数(召回率和精确率的综合指标)来量化系统好坏,而不是拍脑袋判断。这是业界评估RAG系统的标准做法。
为什么重要只看一个指标会被误导——检索系统必须在「不漏」和「不滥」之间找平衡,才能让AI的回答既全面又靠谱。
BM25 关键词检索
一种按「关键词出现频率」给文档打分排序的经典算法,词出现越多、文档越短,得分越高,找精确词超好用。
就像图书馆管理员翻书的目录和索引——你说「查第289号文件」,他直接翻索引卡找,不需要理解这句话什么意思,找到「289号」字样的就给你。
真实案例BM25是1994年就提出的老算法,但到今天Elasticsearch、OpenSearch等主流搜索引擎默认还在用它。OpenAI在官方RAG教程里明确建议:遇到含有专有名词、SKU编号、法规条款等场景时,先跑BM25再配合向量检索,因为向量模型对「GPT-4o-mini」这类精确词的理解反而不如直接字符串匹配。据Elastic官方博客,大量企业在引入语义搜索后依然保留BM25作为混合检索的一路。
为什么重要向量检索很聪明但不认识「精确名字」;BM25不聪明但认字,两者搭档才能应对现实世界里大量含编号、代号、术语的文档。

AI Agent 智能体 · 6 个概念

AI Agent 智能体
一个能自己定目标、自己想办法、自己动手执行、遇到障碍自己调整的 AI 程序,不用人类一步步盯着它干。
就像你雇了一个全职助理:你说「帮我把这次出差安排好」,他会自己查机票、订酒店、发日历邀请,全程不需要你每一步都点头确认。
真实案例Anthropic 的 Claude 被接入 Sierra(一家 AI 客服公司)后,用户发一条「我的订单搞错了」,Agent 会自己去查订单系统、判断责任方、触发退款流程,整个过程不经过人工中转。Sierra 官网披露其客户平均把一线客服自动化率做到了 80% 以上。
为什么重要以前 AI 只会「回答问题」,Agent 让 AI 开始「完成任务」,这是从工具到员工的质变。
ReAct(推理 + 行动循环)
AI 解决问题时,先想一步、再做一步、看看结果、再想再做,像侦探破案一样一步步推理,而不是一口气猜答案。
就像你做一道从没见过的菜:先想「应该先炒香料」,炒完闻一下味道,再想「油放多了得加点醋平衡」,不断尝-调-尝,而不是照着记忆一次性下完所有料。
真实案例2022 年谷歌研究团队在论文《ReAct: Synergizing Reasoning and Acting in Language Models》里首次系统提出这个框架,实验表明在多跳问答任务上准确率比纯推理模式高约 10 个百分点。OpenAI 的 GPT-4 代码解释器本质上也是这个逻辑:每写几行代码就运行一下,看报错再修。
为什么重要AI 一次性给答案很容易错;让它边干边看结果、边修正,复杂任务的成功率大幅提升。
Plan-and-Execute(先规划再执行)
AI 接到复杂任务后,先拆成有顺序的子任务清单,再一步步去执行,而不是边想边跑。
就像装修队接了个全屋改造:项目经理先开会排好「拆墙→水电→泥工→木工→油漆」的工序表,然后各工种按计划进场,而不是今天想到哪儿凿到哪儿。
真实案例Cognition AI 的 Devin(号称首个「AI 软件工程师」)在 2024 年初演示中接到一个「给我做一个数据可视化网站」的需求,它先输出一份含 12 个步骤的执行计划(搭框架→写后端→对接数据→调样式→写测试),再依序完成。这种结构让外部监督者能在任意步骤介入纠偏。
为什么重要任务越复杂越需要全局视角,先规划能避免 AI 走弯路、返工,也让人类更容易监督和纠错。
工具调用 Tool Use
AI 在回答或完成任务时,可以主动去「用」外部工具——比如搜索网页、查数据库、发邮件——而不是只靠自己肚子里的知识。
就像一个律师,光靠背法律条文还不够,他得能去查案例库、调档案室、联系法院,「手边有多少工具、会不会用」决定了他能解决多难的案子。
真实案例Glean(企业知识搜索工具,估值据报道约 46 亿美元)把 AI 接入公司内部的 Slack、Confluence、Jira 等几十种系统。当员工问「我们 Q3 的销售目标是多少」,AI 不靠训练数据猜,而是实时调用 Jira 和内部文档的搜索 API,把真实数据拿回来再回答。
为什么重要AI 的训练知识有截止日期、有盲区;Tool Use 让它能实时获取真实数据,从「知识库」变成「办事员」。
Function Calling(函数调用)
AI 输出一段结构化的「指令」,告诉外部程序「去帮我执行某个具体操作,参数是这些」,是工具调用在技术层面的实现方式。
就像你去餐厅点餐,你说「一份宫保鸡丁,不要辣」——服务员把这句话转成一张标准化的厨房工单(菜名、规格、备注),厨师按工单做,而不是凭自己理解现场发挥。Function Calling 就是那张标准化工单的格式协议。
真实案例OpenAI 在 2023 年 6 月的 API 更新中正式推出 Function Calling,允许开发者预先定义函数签名(比如 get_weather(city, date)),模型在对话中遇到相关需求时会自动输出一个 JSON 结构体而不是普通文字,外部代码捕获后直接执行。这一特性让接入真实业务系统的集成工作量据开发者反馈减少了数倍。
为什么重要没有这个标准,AI 的回答是自由文本,程序很难稳定解析;有了它,AI 和代码之间就有了可靠的「接口语言」,像插座和插头终于配套了。
多智能体协作 Multi-Agent
多个 AI Agent 分工合作完成一个大任务,每个 Agent 只负责自己擅长的部分,由一个「总指挥」Agent 统筹协调。
就像开一家餐馆:老板负责拍板菜单,采购员负责进货,厨师负责做菜,服务员负责上菜,收银员负责结账,各司其职但目标一致——没人能一个人全包圆。
真实案例微软在 AutoGen 框架(2023 年开源,GitHub 获星数超过 3 万)中演示了一个代码调试场景:一个「程序员 Agent」写代码,一个「测试员 Agent」跑测试、报错误,一个「评审 Agent」审代码质量,三者通过自动对话迭代,最终产出通过测试的代码,全程无需人类介入。
为什么重要单个 Agent 能力有上限,复杂任务靠分工协作才能覆盖更大范围、互相校验、减少单点失误。

Agent 进阶机制 · 6 个概念

短期记忆 Short-term Memory
AI 在一次对话里临时记住的内容,对话结束就清空,就像人的工作台,放当前在用的东西。
就像你打电话时在草稿纸上记的号码,挂了电话就扔掉,下次打电话得重新写。
真实案例ChatGPT 最初发布时,每次新对话它都是「失忆」状态——你昨天告诉它你叫什么名字,今天打开新窗口它完全不知道。OpenAI 后来才引入「记忆」功能让部分内容跨对话保留。业界通常把单次对话能容纳的文字量称为「上下文窗口」,GPT-4o 约 128K tokens,Claude 3 系列最高支持约 100 万 tokens,窗口越大,短期能记住的东西越多。
为什么重要短期记忆决定 AI 在当前任务里「脑子装多少」——太小就像便利贴写满了,刚说过的事它就忘了,任务做到一半就掉链子。
长期记忆 Long-term Memory
AI 跨对话、跨任务都能记住的信息,存在外部数据库里,需要时再调出来用,不会因为对话结束就丢失。
就像餐厅老板在本子上记的老客户口味偏好——这桌老王不吃香菜,下次他来直接就知道,不用他再说一遍。
真实案例企业知识库 AI 产品 Glean 的核心卖点之一就是长期记忆:它把公司内部文档、历史对话、员工偏好都建成索引,员工不管什么时候来问,都能调出以前的上下文。类似地,Anthropic 在 2024 年为 Claude 推出了「Projects」功能,让用户可以把背景材料、工作偏好长期存储,AI 每次对话都能调取。
为什么重要没有长期记忆,AI 每次都是「第一次见面」,在企业里就意味着每次都要重新交代背景,效率极低。
多智能体 Multi-Agent
不止一个 AI 在干活,而是一群分工合作的 AI 小队,各自负责不同环节,共同完成一个大任务。
就像一家律师事务所接了大案子,合伙人拆分任务,一个负责查法条、一个负责写状纸、一个负责核对证据,最后主任律师汇总——不是一个人包揽全部。
真实案例AI 法律服务公司 Harvey 在给顶级律所提供服务时,用的就是多智能体架构:一个 Agent 负责检索判例,另一个负责起草合同条款,还有一个专门做风险审查,彼此传递结果。Anthropic 在 2025 年发布的 Claude 多智能体框架中,把这种结构明确拆成「编排者」和「执行者」两层,据报道可以将复杂法律任务处理速度提升数倍。
为什么重要单个 AI 脑子再大也有极限,复杂任务分给多个专精的 AI 并行处理,又快又准,不容易翻车。
工作流编排 Workflow Orchestration
预先把 AI 要做的每一步动作、判断条件、出错处理都规划好,像流水线一样自动按顺序执行,不需要人盯着。
就像装修公司给你排施工计划:先拆墙,再水电,再瓷砖,再刷漆,每道工序完了才能到下一道,哪步出问题有应急方案,项目经理不用一直在场。
真实案例数据分析平台 Palantir 的 AIP(AI Platform)把工作流编排作为核心功能之一:企业把「采购分析」这件事拆成数据拉取、模型推理、报告生成、审批推送四步,一键触发全自动跑完,据报道已服务数十家军工和金融客户的运营自动化场景。国内科大讯飞的「星火智能体」平台同样提供可视化工作流拖拽编排,让不懂编程的业务人员也能搭流程。
为什么重要没有编排,AI 只是「聊天工具」;有了编排,AI 才能真正替代重复性的业务流程,从助手变成员工。
LangGraph
一个专门帮开发者搭建「有来有回、能循环决策」的 AI 流程的开源框架,让 AI 可以根据中间结果随时调整下一步动作。
就像地铁路线图,不是一条线走到底,而是有站点可以换乘、可以折返——AI 干着干着发现路走错了,能原地掉头重来,而不是只能直着走到终点。
真实案例LangGraph 是 LangChain 公司在 2024 年推出的框架,专门解决「AI 只能线性执行」的问题。它用图(Graph)的概念,让每个节点代表一个操作,边代表条件跳转,Agent 可以在节点间循环、回退、并行。GitHub 上该项目在发布数月内就获得了数万 star,大量开发者用它构建「会反思、会重试」的 Agent,比如让 AI 写代码后自动测试,测试失败自动回到写代码步骤重试。
为什么重要真实任务很少是直线的,LangGraph 让 AI 工作流能处理「走一步看一步」的复杂情况,而不是遇到分叉就卡死。
验证钩子防幻觉传播 Validation Hooks
在 AI 流水线的关键节点插入一个「检查员」,每一步的输出经过核实才能传给下一步,防止一个错误带着跑完全程。
就像工厂流水线上的质检员——零件从上道工序出来,先量一量、看一看,不合格的打回去返工,不让次品流到下一道工序污染整批货。
真实案例医疗 AI 公司 Nabla 在临床辅助诊断产品中就内置了多层验证钩子:AI 生成的诊断建议先经过规则引擎核查(比如药物剂量范围),再经过第二个模型做置信度评分,只有双重通过才展示给医生。这正是因为大模型的「幻觉」问题——AI 可能一本正经地给出根本不存在的药品名或错误数据,在多 Agent 流水线里一旦第一步出错不拦截,错误会像病毒一样扩散到每一个下游环节,最终产出一份「错得很自信」的报告。
为什么重要多 Agent 系统里,一个 Agent 的幻觉会被下游当成事实继续加工,验证钩子是防止「错误雪球越滚越大」的最后防线。

MCP 与系统连接 · 5 个概念

MCP 模型上下文协议(Model Context Protocol)
一套让 AI 助手和各种外部工具「说同一种语言」的通用规范,有了它,AI 不用为每个工具单独学一套对接方式。
就像餐厅用的「点餐小票格式」,无论是火锅店还是寿司店,厨房看到小票就知道该做什么,不用每家餐厅重新培训服务员。
真实案例2024 年 11 月,Anthropic 开源了 MCP 协议。短短几个月内,Zed 编辑器、Replit、Sourcegraph 等数十家公司相继接入,开发者只需写一次「MCP 服务器」,Claude、Cursor 等任何支持 MCP 的 AI 都能调用,省去了为每个 AI 重复开发插件的工夫。
为什么重要它解决了「每接一个新 AI 就要重写一遍对接代码」的重复劳动问题,让工具一次接入、处处可用。
连接器 Connector
一段专门负责「搭桥」的代码或模块,让 AI 系统能够读写某个具体的外部服务,比如数据库、邮件或文件系统。
就像装修时买的「转换插头」,国内家电插英国插座,中间那个小方块就是连接器,两头都不用改,中间帮你适配。
真实案例Glean 是一家企业搜索公司,他们为 Salesforce、Slack、Google Drive、Jira 等超过 100 个企业系统各自写了一个 Connector,员工用 AI 搜「上季度销售合同」时,Connector 负责去对应系统里捞数据,AI 本身完全不需要知道每个系统的内部结构。
为什么重要没有 Connector,AI 就像一个聪明的员工被锁在小黑屋里,再厉害也拿不到任何公司数据。
API(应用程序接口)
一个软件对外开放的「服务窗口」,其他程序按规定格式来问,它就按规定格式来答,双方不用知道对方内部怎么运作。
就像奶茶店的点单窗口,你不需要进厨房,只需要按菜单点「一杯半糖珍珠奶茶」,窗口给你出杯,里面怎么做的你不用管。
真实案例OpenAI 的 API 每个月处理数以亿计的请求——从 Notion 的 AI 写作助手到各家企业自建的客服机器人,背后调的都是同一个 API 接口。开发者不需要自己训练模型,只要往那个窗口发一段文字,就能拿回 AI 生成的回答,整个过程几百毫秒。
为什么重要API 让「用别人的能力」变成了一件开箱即用的事,不用从头造轮子。
适配器 Adapter
在两个「说话方式不一样」的系统之间做翻译的中间层,把一方的格式转成另一方能听懂的格式,两边都不用改自己。
就像找了个懂中英双语的翻译,中国客户说中文,美国供应商说英文,翻译在中间实时转换,双方都不用学对方的语言。
真实案例Harvey 是专门给律师事务所用的 AI 工具。各家律所用的案件管理系统五花八门,有用 Clio 的、有用 iManage 的、还有自建系统的。Harvey 为每套系统写了 Adapter,把不同格式的案件文档统一转成 AI 能处理的标准格式,律师不需要换软件,AI 也不需要为每套系统单独训练。
为什么重要它解决了「新系统和旧系统格式不兼容」的历史遗留问题,不用推倒重来,插个 Adapter 就能接上。
权限沙箱(Permission Sandbox)
给 AI 划一块「只能在这里活动」的边界,它能看什么、能改什么、能调用什么,都提前限定死,出不了这个圈。
就像给新来的实习生办了一张门禁卡,只能进前台和会议室,财务室和服务器机房的门刷不开,不是不信任他,是规矩如此。
真实案例Palantir 在给美国政府部门部署 AI 平台 AIP 时,核密级文件和普通行政文件放在完全隔离的沙箱里。即便同一个 AI 助手在服务不同级别的用户,低权限用户的 AI 实例物理上就拿不到高密级数据,据报道这是政府客户采购的硬性合规要求。
为什么重要AI 越能干,失控的代价越大——沙箱是让「万一出问题」的损失控制在可接受范围内的保险丝。

模型微调技术 · 5 个概念

微调 Fine-tuning
把一个已经很厉害的通用 AI,用你自己的数据再训练一遍,让它专门听你的话、干你的活。
就像招了一个全能名校毕业生,你不从头教他认字,而是让他在你公司跟着师傅干三个月,专门学你们公司的业务流程和行话。
真实案例Harvey 是一家给律所用的 AI 公司,他们没有从零训练模型,而是拿 GPT-4 做微调,让它专门处理合同审查、案例检索、法律备忘录。2023 年 Harvey 在 Allen & Overy(全球顶级律所之一)落地,据报道使用后律师处理文件的速度大幅提升。通用模型讲不好法律黑话,微调后就能。
为什么重要从零训练一个大模型要花几亿美元,微调只要几千块甚至更少,让普通公司也用得起专属 AI。
LoRA(低秩适配)
微调模型时不改动原来的大脑,只在旁边加一小块「补丁」,训练这个补丁就够了,省钱省显卡。
就像你不敢在原装家具上凿洞,于是买了一块小木板拼在旁边——主体没动,新功能加上去了,搬走补丁恢复原样。
真实案例Stable Diffusion 社区用 LoRA 训练「特定风格」或「特定人脸」的画风包。一个标准 Stable Diffusion 模型有几个 GB,而一个 LoRA 补丁文件只有几 MB 到几十 MB。Civitai 网站上有数万个社区用户自制的 LoRA,任何人用一台普通游戏电脑就能在几小时内完成训练,这在全量微调时代几乎不可能。
为什么重要显卡不够、预算有限的团队,用 LoRA 同样能做出专业级的模型定制,把微调的门槛降低了一个数量级。
QLoRA
在 LoRA 的基础上,先把大模型「压缩打包」成很小的体积塞进显卡,再做微调,让消费级显卡也能训练大模型。
就像行李箱装不下衣服,你先把衣服真空压缩袋压扁,再放进去——东西还是那些东西,占地方小了很多,能带走了。
真实案例QLoRA 由华盛顿大学 Tim Dettmers 团队在 2023 年提出,论文发布后迅速轰动社区。他们演示了在一张消费级 48GB 显卡上,对 650 亿参数的 LLaMA 65B 模型做微调——按以前的方法这至少需要数张 A100(每张约 1 万美元以上)。这让「个人开发者在家微调大模型」从幻想变成了现实。
为什么重要解决了「模型太大、显卡装不下」的核心瓶颈,让本地私有化部署+微调真正平民化。
全量微调
把模型所有的参数(也就是它全部的「知识」)都重新调整一遍,最彻底但也最贵、最费显卡。
就像把一个厨师从头到尾重新培训一遍,不只教他加一道菜,而是把他所有的厨艺习惯、手法、食材认知都推倒重练。
真实案例OpenAI 早期把 GPT-3 做全量微调变成 InstructGPT(也就是 ChatGPT 的前身),让模型从「补全文字的工具」变成「听人话的助手」。这次微调涉及模型全部 1750 亿参数,需要庞大的计算资源,一般公司根本复制不了,这也是为什么后来 LoRA 类方法这么受欢迎。
为什么重要效果最好、改造最彻底,适合有钱有资源的大厂做从根本上改变模型行为的升级。
灾难性遗忘 Catastrophic Forgetting
AI 学了新东西之后,把之前会的东西忘得一干二净——就像人学了新语言结果把母语忘了。
就像一个厨师被强制去学甜点,结果回来发现他把炒菜怎么放盐都忘了——新技能学会了,老技能清空了。
真实案例这是 AI 领域长期存在的真实难题。谷歌 DeepMind 在 2017 年发表了一篇著名论文,专门讨论神经网络「学新忘旧」的问题,并提出 EWC(弹性权重巩固)方法来缓解它。现实里,一些公司曾直接用内部数据对 GPT 类模型做全量微调,结果模型在新任务上表现变好了,但通用问答、推理能力却明显下降,等于用 A 换 B 得不偿失。
为什么重要搞清楚这个问题,才能明白为什么 LoRA 这类「只加补丁不动原体」的方案这么受欢迎——它天然避开了这个坑。

部署与量化 · 6 个概念

量化 Quantization
把模型的数字精度「缩水」,让它占更少空间、跑更快,但聪明程度损失不大。
就像把一张 4K 照片压成手机壁纸——肉眼看差不多,但文件从 50MB 缩到了 2MB,发微信再也不卡了。
真实案例Meta 发布的 Llama 3 70B 原版模型完整精度(FP16)需要约 140GB 显存,普通人根本跑不动。经过 4-bit 量化之后,同一个模型缩到约 40GB,用两张消费级 GPU 就能部署。这也是 Meta 故意把量化版和原版一起开源的原因——让更多人能在自己电脑上跑起来。
为什么重要没有量化,顶级大模型只能活在云端服务器里;有了量化,才让本地部署成为可能。
GGUF
一种专门为在普通电脑(包括 CPU)上跑量化大模型设计的文件格式,下载一个文件就能直接用。
就像以前装软件要下一堆 DLL 东拼西凑,现在直接下一个「绿色版单文件」,解压即用,啥都打包在里面了。
真实案例llama.cpp 项目的作者 Georgi Gerganov 在 2023 年设计了 GGUF(前身是 GGML),专门解决模型文件格式混乱的问题。现在 Hugging Face 上搜任何热门模型,都能找到以 .gguf 结尾的量化版本,下载后直接用 Ollama 或 llama.cpp 运行,不需要装 Python、不需要显卡,普通笔记本也能跑。
为什么重要它让「下载即用」成为现实,是大模型进入普通用户电脑的最重要通道之一。
AWQ(Activation-aware Weight Quantization)
一种更聪明的量化方法,它先分析哪些参数最重要,重要的保留精度,不重要的大力压缩,整体效果比粗暴压缩好很多。
就像打包行李,聪明的做法是把易碎品单独裹上气泡膜、其他衣服随便塞,而不是所有东西一律用同一种方式打包——省空间又不容易摔坏重要的。
真实案例MIT 韩松团队在 2023 年发表了 AWQ 论文,随后被 vLLM、TGI 等主流推理框架迅速采用。MIT-IBM Watson AI Lab 的测评显示,同样压到 4-bit,AWQ 相比更早的 GPTQ 方法在多项基准测试上准确率高出 1-3 个百分点。现在月之暗面(Moonshot)、智谱 AI 等国内厂商发布本地量化版时,AWQ 格式已经成为标配选项之一。
为什么重要量化不可避免会损失精度,AWQ 是目前「损失最小」的主流方案之一,让本地部署的模型尽量「不变蠢」。
vLLM
一个专门让大模型「高并发、高速度」对外提供服务的推理框架,让同一张 GPU 能同时服务更多人。
就像餐厅从「一桌点完菜才做下一桌」升级成「后厨流水线同时备多桌的料」——翻台率翻倍,顾客等的时间也短了。
真实案例UC Berkeley 在 2023 年发布了 vLLM,其核心技术「PagedAttention」把显存管理方式彻底重写,让同等硬件下的吞吐量相比当时 HuggingFace 的原生推理提升了约 24 倍(论文数据)。Anyscale(Ray 的公司)、Mistral AI 官方都采用 vLLM 作为推理后端。现在国内主流云厂商(阿里云、腾讯云)的大模型 API 背后也有大量 vLLM 集群在跑。
为什么重要没有高效推理框架,一台 GPU 服务器一次只能服务几个人;用了 vLLM,同样的硬件成本能撑住几十倍的并发压力。
Ollama
一个傻瓜式工具,让你在自己电脑上一条命令就能下载并运行各种开源大模型,跟在本地装应用一样简单。
就像 App Store——以前装软件要找安装包、配环境、搞依赖,现在搜一下点安装,30秒就能用,Ollama 对大模型做的就是这件事。
真实案例Ollama 由前 GitHub 员工 Jeff Dichio 等人于 2023 年创立,开源后在 GitHub 上迅速积累超过 10 万 star。它让「ollama run llama3」这样一条命令成为可能——模型自动下载、自动量化适配、自动起服务,本地还开一个兼容 OpenAI 格式的 API 接口,方便接各种应用。国内不少开发者用它在 MacBook 上跑 Qwen2.5,完全不需要联网调用任何云 API。
为什么重要它把大模型本地部署的门槛从「需要懂 Linux + Python + CUDA」降到了「会用终端就行」,让本地 AI 真正飞入寻常百姓家。
显存 VRAM 占用
跑大模型时 GPU 里装模型和计算中间值需要占用的内存,显存不够就直接报错跑不起来。
就像炒菜的锅——食材(模型)要放得下,炒的过程(计算)也要有空间翻炒;锅太小,食材塞进去了,但一炒就溢出来了。
真实案例GPT-4 级别的模型据业界估计参数量超过 1 万亿,完整精度推理需要数千 GB 显存,根本不可能本地跑。而 Mistral 7B 的 FP16 版本约需 14GB 显存,4-bit 量化后只需约 4GB,一张入门级 RTX 3060(12GB 显存)就能跑得飞快。这个数字是每个想本地部署模型的人第一个要查的参数——买模型之前先量量锅够不够大。
为什么重要显存是本地大模型部署最硬的物理瓶颈,搞清楚这个数字,才能选对模型和量化方案,不至于买了显卡跑不起来。

评测与可观测性 · 6 个概念

评估集 Eval Set
一批专门用来给 AI 打分的「考试题库」,里面有问题、有标准答案,专门用来测 AI 答得好不好。
就像高考模拟卷,出题人提前整理好题目和评分标准,学生(AI)来答,答完对照答案打分,看这次模型是进步了还是退步了。
真实案例OpenAI 在训练 GPT-4 时,内部用了几百套不同领域的 eval set,涵盖数学推理、代码生成、事实问答等类别。他们每次改模型都要跑一遍这些题,确认改动没有让某些能力变差——这套机制业界称为「回归测试」。Anthropic 也公开过 Claude 的部分 eval 结果,包括 MMLU(知识问答)等标准题库上的得分。
为什么重要没有 eval set,你根本不知道模型是变好了还是变坏了,调参全靠感觉,出了问题也找不到原因。
LLM-as-Judge
用一个大语言模型来给另一个大语言模型的回答打分评判,相当于让 AI 当考官。
就像你让公司里资历最深的人来面试新员工,不是用选择题测,而是让老员工看了回答之后说「这个回答好/不好,原因是…」。
真实案例Chatbot Arena(由 UC Berkeley LMSYS 团队运营)曾让 GPT-4 充当裁判,对比两个匿名模型的回答哪个更好,评分结果和人类投票的吻合率据报道超过 80%。Anthropic 内部也大量使用 Claude 自身来批量评估 Claude 新版本的输出质量,节省了大量人工标注成本。
为什么重要人工打分太慢太贵,一天能评几千条就不错了,而 LLM-as-Judge 可以一晚上跑几十万条,让大规模自动评估变得可行。
RAGAS
专门用来测「检索增强生成(RAG)」效果好不好的一套评分框架,能自动算出 AI 检索对不对、回答准不准。
就像外卖平台的五星评分系统,但拆得更细:不只问「好不好吃」,还要分别打「配送速度/温度/份量/口味」四个维度,让你知道差在哪。
真实案例RAGAS 是 2023 年由 Exploding Gradients 团队开源的评估框架,在 GitHub 上迅速获得数千 star。它提供「忠实度(Faithfulness)」「答案相关性(Answer Relevancy)」「上下文召回(Context Recall)」等具体指标,业界在搭建企业知识库问答系统时普遍用它来量化 RAG 管道好不好——比如判断 AI 是真的从文档里找到了答案,还是在胡说。
为什么重要RAG 系统出问题时你不知道是「搜索没搜到」还是「搜到了但没用上」,RAGAS 把这两件事拆开量化,让排查有据可查。
链路追踪 Trace
把 AI 处理一次请求的每一步都记录下来,形成一条完整的「操作日志流水账」,出了问题可以一步步往回查。
就像快递的物流跟踪,从下单、发货、出仓、途中、签收每个环节都打时间戳,包裹丢了你能精确知道卡在哪个节点,而不是只知道「没到」。
真实案例Palantir 的 AIP 平台在内部 Agent 调用链中大量依赖 trace 机制:一个 AI 任务可能涉及「理解问题→检索数据库→调用外部 API→生成报告」四步,每步耗时、输入输出全部记录。当某次分析结果出错时,工程师打开 trace 界面,几分钟就能定位是哪个步骤返回了脏数据,而不是在几千行日志里盲猜。
为什么重要AI 应用不像传统程序报错直接报行号,中间黑盒太多,没有 trace 就只能靠猜,线上出问题时代价极高。
LangSmith
LangChain 官方出的一个「AI 应用监控平台」,帮你记录、回放、评分 AI 的每一次对话和调用,方便调试和持续改进。
就像餐馆老板装了一套监控系统,每道菜从下单到上桌全程录像,哪道菜被退了、退菜的原因是什么、哪个厨师做的,一目了然,出了问题立刻回放找原因。
真实案例LangChain 公司在 2023 年推出 LangSmith 后,据报道在发布后数月内就积累了数万名开发者用户。很多国内出海 AI 创业团队用它来监控自己的客服机器人——当用户投诉「AI 回答驴唇不对马嘴」时,产品经理直接在 LangSmith 界面搜索那条对话的完整 trace,看到是检索步骤返回了不相关文档,几分钟内定位问题根因。
为什么重要AI 产品上线后像个黑盒,你不知道用户在问什么、AI 在哪里犯错,LangSmith 把这个黑盒变成透明的,是从「能用」到「好用」的关键一步。
Langfuse
一个开源的 AI 应用可观测性平台,功能和 LangSmith 类似,但可以自己部署在自家服务器上,数据不出门。
就像选择自建监控室还是租赁物业公司的监控服务——LangSmith 是租人家的,Langfuse 是自己装一套,数据都在自己手里,特别适合对数据安全有要求的企业。
真实案例Langfuse 由德国团队于 2023 年开源,很快在 GitHub 上获得超过 1 万 star,成为 LangSmith 最主要的开源替代品。国内不少金融、医疗行业的 AI 项目组因为数据合规要求(不能把用户问题发到境外服务器),选择把 Langfuse 私有化部署在自己的内网,既能做 trace 监控又满足安全审计要求。
为什么重要很多行业(金融、医疗、政务)的数据不允许上第三方云,Langfuse 让这些场景也能用上完整的 AI 可观测性能力,不用在「功能」和「合规」之间二选一。

数据工程基础 · 6 个概念

ETL 数据管道(ETL Pipeline)
把各处散乱的原始数据,自动抽出来、清洗干净、再塞进数据库里的一条自动化流水线。
就像餐馆的备餐流程:从市场采购食材(Extract)、洗菜切菜(Transform)、备好摆进备菜冰箱(Load),厨师随时能取用,不用临时去市场买。
真实案例Airbnb 早期用手工 SQL 脚本同步数据,每次业务改动都要人工跑一遍,出错率极高。后来他们开源了 Apache Airflow,把所有数据流水线变成可视化、可调度的 DAG 任务图。现在 Airflow 是业界最流行的 ETL 编排工具之一,被数千家公司用于每天调度数百万次数据任务。
为什么重要没有 ETL,数据就是一堆孤岛,业务跑着跑着没人知道哪里的数字是对的。
数据治理(Data Governance)
给公司所有数据定规矩:谁能看、谁能改、哪个数字算官方标准、谁来负责——就是数据的「管理制度」。
就像物业管小区:每把钥匙管哪个房间、访客要登记、公共区域谁打扫、出了事找谁——没有这套规矩,小区就乱成一锅粥。
真实案例2018 年 Facebook 数据泄露事件(剑桥分析丑闻)曝光后,欧盟 GDPR 正式生效,规定企业必须清楚地知道用户数据存在哪、用于什么、谁能访问。Meta 随后不得不重建整套数据血缘和权限管理体系,据报道合规改造花费超过数十亿美元。
为什么重要数据治理缺位,企业要么因为数据混乱做出错误决策,要么因为违规被监管罚得倾家荡产。
脏数据(Dirty Data)
数据库里存的那些残缺、重复、格式乱、或者根本就是错的数据——就是「质量差到不能直接用」的数据。
就像你让一百个人手填纸质问卷,有人漏填、有人乱写、有人填「18岁」有人填「018」——汇总成 Excel 之后,你根本不知道哪条是真的。
真实案例据 IBM 研究报告估算,脏数据每年给美国企业造成约 3 万亿美元损失。一个典型案例:某零售连锁用客户地址做促销邮件推送,因为历史录入时格式不统一(「上海市」「上海」「SH」混用),系统把同一个人当成三个客户,反复寄出重复优惠券,促销预算严重虚耗。
为什么重要再好的 AI 模型、再漂亮的报表,喂进去脏数据,出来的结论就是垃圾——行业里叫「垃圾进,垃圾出(Garbage In, Garbage Out)」。
向量索引(Vector Index)
把文字、图片等内容转成一串数字,然后建一张「相似度地图」,让你能快速找到「意思最接近」的内容,而不是只会匹配关键词。
就像图书馆不按书名字母排书,而是按「内容风格」分区——惊悚小说堆一块、浪漫爱情堆一块,你走进去找「感觉像东野圭吾」的书,直接奔那片区,而不是翻遍整个馆。
真实案例OpenAI 旗下的 ChatGPT 企业版以及 Glean(企业搜索独角兽)都大量依赖向量数据库来做「语义搜索」。Pinecone、Weaviate 等向量数据库公司在 2023 年前后估值快速攀升,Pinecone 据报道融资后估值超过 7 亿美元,核心卖点就是:让企业几毫秒内从几千万条文档里找到「意思最像」的那条。
为什么重要传统关键词搜索找不到「同义词」和「语义相关」的内容,向量索引让 AI 应用真正能理解「你想要什么」而不是「你写了什么」。
幂等设计(Idempotent Design)
同一个操作不管执行一次还是执行一百次,结果都一样,不会产生多余的副作用——就是「重复做也不会出错」的设计原则。
就像电梯按楼层按钮:你按了 5 楼,不管按一次还是狂戳十次,电梯只去一次 5 楼,不会跑十次——这就是幂等。反例是点餐 App 的「下单」按钮,如果不做幂等,网络卡顿时你狂点三下,就可能下了三单。
真实案例2021 年,Robinhood 曾因为支付系统重试逻辑缺陷,导致部分用户账户出现重复扣款或重复到账的异常。这类问题在金融支付系统里极其经典——支付宝、微信支付的工程师在设计转账接口时,幂等性(每笔订单有唯一 ID,重复提交只处理一次)是绝对不能省略的基础设计,否则每次网络抖动都可能让用户多付钱。
为什么重要网络永远会抖,系统永远会重试,没有幂等设计,重试就变成「重复犯错」,轻则数据乱,重则多扣用户的钱。
数据血缘(Data Lineage)
记录一条数据从哪里来、经过哪些处理、最后流向哪里——就是数据的「族谱」或「行程记录」。
就像一瓶牛奶的溯源码:哪个牧场、哪头牛、哪天挤的奶、经过哪家工厂、什么时候出厂——出了食品安全问题,能立刻顺藤摸瓜。
真实案例Palantir 的核心产品之一就是为大型机构(美军、大型银行、制药公司)提供数据血缘可视化。据报道,某跨国银行在使用 Palantir 之前,一旦监管要求说明「这个风险报表里的数字从哪来」,需要人工追查数周;接入数据血缘系统后,同样的问题几分钟内就能出图解释清楚。
为什么重要没有数据血缘,数据出错你不知道根在哪,报表被质疑你解释不清楚,监管来查你只能两眼一抹黑。

系统集成模式 · 6 个概念

旁路集成(Bypass/Sidecar 拓扑)
新系统悄悄站在旧系统旁边「偷听」数据,不动旧系统一行代码,像个影子一样工作。
就像餐厅门口来了个外卖平台的驻场员,自己记单自己传单,厨房那边完全感知不到他的存在,厨师还是按老流程炒菜。
真实案例Palantir 早期给美国政府机构做情报分析时,对方的核心业务系统根本不允许改动。Palantir 的做法就是旁路接入:把各系统的数据流「旁抄」一份进自己平台,原有系统零改动继续运转,分析层在旁边独立工作。这让他们能在不触碰敏感旧系统的前提下快速上线。
为什么重要旧系统改不动、不敢动,但又必须让新 AI/分析工具用上数据——旁路让你两头都不耽误。
嵌入集成 vs 代理集成(Embedded vs Proxy 拓扑)
嵌入是把新功能直接塾进旧界面里用户感知不到切换;代理是所有请求先经过一个中间层由它核查和转发。
嵌入就像装修时在老橱柜里加了新烤箱,外观不变、内藏功能;代理就像公司前台,客人不直接进办公室,全由前台安排转接。
真实案例Glean 和 Salesforce 的集成是嵌入模式:销售员不用打开独立网页,在 Salesforce 页面的侧边栏就能看到 AI 搜出的相关资料;而 Kong AI Gateway 属于代理模式,让企业在不改业务代码的情况下统一管控所有 LLM 调用的鉴权、限流和日志。两种拓扑各有适用场景,不能互替。
为什么重要拓扑选错会直接导致用户不愿用或系统失控——嵌入为用户体验服务,代理为平台管控服务。
OAuth 鉴权
一种让你用 A 网站的账号授权 B 网站代你干活,但密码全程不暴露的机制。
就像把钥匙复制了一把给钟点工,她能开门打扫,但拿不走你的原始钥匙,且你随时可以把那把复制钥匙收回。
真实案例你用「微信登录」打开某 App 时,跑的就是 OAuth 2.0 流程:微信发给那个 App 一个临时通行令牌,App 拿令牌去微信核验你是谁、取头像,密码全程没有暴露。GitHub 在 2020 年报告平台上有超过 30 万个第三方应用通过 OAuth 接入,是开发者生态互联的核心基础。
为什么重要不用到处输密码且随时可撤销授权——安全和方便两全。
RPA(机器人流程自动化)
让软件机器人模拟人的鼠标点击和键盘操作,把那些重复的电脑操作自动完成,不需要改任何底层系统。
就像集了一个不知疲倦的实习生,每天帮你复制粘贴、填表格、在系统间来回倒数据,你只负责告诉他步骤。
真实案例UiPath 是全球最大的 RPA 公司之一,2021 年上市时市值一度超过 300 亿美元。典型客户是银行:审批员原本要手动把几十个客户的资料从邮件复制到核心系统,UiPath 机器人接手后据报道处理速度快了约 80%,且 24 小时不停。
为什么重要大量旧系统没有 API,RPA 是唯一能让它们被自动化而不大改系统的办法。
数据回流(Data Write-back)
AI 或分析工具处理完数据后,把结果自动写回到业务系统的原始记录里,而不是只停在分析平台内部。
就像请人帮你分析完账单,把结论直接写回你自己家的账本里,而不是另外给你一张纸——你打开账本就能直接看到结论。
真实案例Salesforce Einstein AI 做完销售预测后,会把「成单概率评分」直接写回 CRM 内的商机记录,销售员在 CRM 看客户时就能直接看到 AI 打的分,不用切换到任何分析界面。这种回流让 AI 洞察真正融入了日常工作流。
为什么重要分析结论如果停在分析工具里没人看就是白做——回流才能让 AI 建议影响每个具体业务决策。
人工确认队列(Human-in-the-Loop Queue)
AI 做完一批动作后,把「拿不准的」或「风险高的」推进一个待办列表,等真人确认或修改再继续执行。
就像网购退款系统:小额自动退,大额或可疑的单子进「人工审核队列」,客服看一眼没问题再放款。
真实案例Harvey(面向律师的 AI 助手)在帮律所起草合同时,会把 AI 生成的关键条款放进「待律师确认」队列,律师逐条审核批准后才会合并进最终文档。这个设计是有意为之的——法律文件容不得 AI 自作主张,据报道 A16Z 等机构投了 Harvey 超过 1 亿美元,正是因为这种「AI 提效但人类把关」的模式符合专业行业的合规要求。
为什么重要AI 出错的代价有时极高——人工队列让自动化和人类判断在高风险节点精确交接,不是全自动也不是全手动。

产品与认知框架 · 6 个概念

MVP 最小可行产品(Minimum Viable Product)
先做一个能用的最简版本,拿给真实用户用,验证方向对不对,再决定要不要继续投入。
就像你想开一家面馆,与其先装修、买设备、招员工花100万,不如先摆个摊卖一周——如果没人来吃,你还没亏太多;如果排队,再开正店也不迟。
真实案例Dropbox 创始人德鲁·休斯顿在写一行代码之前,先录了一段3分钟的演示视频,假装产品已经存在。视频发布后一夜之间候补名单从5000人涨到7.5万。他用这个信号确认市场真实存在,才动手开发。
为什么重要它解决的是「把钱和时间押在一个没人要的产品上」这个最致命的创业风险——先用最低成本问市场一句「你要不要」。
Jobs-to-be-Done(JTBD,待完成任务)
用户买你的产品,不是因为喜欢它本身,而是因为它能帮他完成一件具体的「任务」——搞清楚那个任务是什么,才是产品设计的起点。
就像你去五金店买电钻,你其实不想要电钻,你要的是墙上那个洞——甚至更深一层,你要的是把画挂上去,让家里好看,让老婆满意。产品只是完成这件事的「工具」。
真实案例哈佛商学院教授克莱顿·克里斯坦森研究过一个奶昔案例:一家快餐连锁发现,早上通勤时段奶昔销量最好,买的人不是嘴馋,而是要在开车时打发漫长的路程——真正的「任务」是用一只手、一杯东西对抗无聊和饥饿感。搞清楚这一点后,他们把奶昔做得更稠、吸管更细,让人喝慢一点,销量明显上升。
为什么重要它解决的是「把产品做得越来越好却越来越没人用」的困局——你优化的是你以为的需求,而不是用户真正在解决的问题。
第一性原理(First Principles Thinking)
不管别人怎么做,先把问题拆到最基本的事实层面,再从头想答案,而不是照着老路子改改就算了。
就像你要从北京去上海,所有人都告诉你坐高铁,你也可以跟着坐——但如果你从头问「运输的本质是什么、有哪些物理上可行的方式」,你可能会想到造飞机、甚至超级高铁。大多数人是在「类比思维」里改良,第一性原理是真的重新设计。
真实案例埃隆·马斯克在创立SpaceX时,火箭造价极高,业界默认「就是这么贵」。他没有接受这个前提,而是拆解火箭的原材料成本,发现铝合金、钛、铜等原料本身只占火箭报价的约2%,其余全是层层加价的供应链和制造惯例。他决定自己买原料、自己造,把发射成本压低到同行的约十分之一。
为什么重要它解决的是「行业里所有人都在用同一套旧假设做同一件事,没人问这些假设本身对不对」的集体盲点。
工作流重设计(Workflow Redesign)
不只是把原来的工作流程搬到新工具上跑,而是趁着引入新能力(比如AI)的机会,从根上重新想这件事该怎么做。
就像餐厅引入收银系统,很多老板只是把手写账单换成电脑打印——但真正的重设计是问:既然系统能自动记录每桌点了什么,服务员是否还需要来回跑去厨房喊菜?整个送餐流程能不能一起改掉?
真实案例法律AI公司Harvey在律所落地时发现,如果只是让律师「把手头的草稿粘给AI润色」,效率提升有限。真正的突破是重新设计工作流:合同尽职调查原来需要律师团队逐条翻阅数百页文件,Harvey介入后变成AI先批量标注风险点、律师只审高风险条款,据报道某些场景下同等质量的工作时间压缩了约80%。
为什么重要它解决的是「买了AI却只当搜索框用,效率没提升反而多了一道工序」的落地陷阱——新工具配新流程,才能真的释放价值。
产品-市场契合度(Product-Market Fit,PMF)
你做的东西刚好戳中了一批人的真实痛点,他们用了就离不开、还会自发推荐给别人——达到这个状态叫找到了PMF。
就像你开了一家包子铺,刚开始每天守着摊等客,某天突然变成——顾客自己排队、卖完就散、有人追着问几点开门。你没多做宣传,人却越来越多,这就是「对上了」的感觉。
真实案例Slack最初是一款游戏公司Glitch内部用的沟通工具,游戏失败后创始人斯图尔特·巴特菲尔德决定把内部工具包装成产品对外卖。2013年内测第一天就有8000家公司申请试用,24小时内注册用户突破1.5万。这种「没花多少钱、用户主动涌来」的状态,就是PMF的典型信号。
为什么重要它解决的是「一直在优化产品,却不知道自己到底有没有做对方向」的焦虑——PMF是判断「该踩油门放大规模」还是「该继续转向」的分水岭。
认知负荷(Cognitive Load)
用户在用你产品时脑子要同时处理的「信息量」——越复杂、越难记、越要想,认知负荷就越高,用户就越容易放弃。
就像装修完交房,你给租客一次性塞了50条注意事项——热水器怎么点火、哪个开关控制哪盏灯、网络密码是啥、垃圾几号收……大多数人当场脑子当机,三天后全忘了。而好的设计是把最重要的3件事贴在门上,其他的用的时候再说。
真实案例Notion早期用户流失率很高,调研发现不是功能不够,而是打开软件的第一眼就有几十种模板和空白选项,新用户不知道从哪里下手。后来Notion重新设计了新手引导,把第一步收窄到「先建一个笔记」,新用户留存率明显改善。这是典型的通过降低认知负荷来提升产品体验的案例。
为什么重要它解决的是「功能明明很多、用户却说难用」的反直觉困境——大脑的处理能力是有限的,让人少想,才能让人多用。

商业与经济学概念 · 5 个概念

边际成本递减
你多生产一份东西,花的钱越来越少,甚至接近零——第一份贵,第一万份几乎免费。
就像你做了一锅汤,第一碗要买菜、烧火、洗锅,之后再盛第二碗、第三碗,几乎不用多花一分钱。
真实案例微软把 Office 装进云端(Microsoft 365)之后,每新增一个用户只需消耗极少的服务器资源,而软件本身的研发成本已经摊在几亿用户头上了。据报道微软云业务毛利率常年维持在约 70% 以上,根本原因就在这里:多卖一份,成本几乎不涨,利润却实打实地增加。
为什么重要它解释了为什么软件和AI公司越大越赚钱,而传统制造业做大了反而容易累死——成本曲线不一样,命运就不同。
护城河(Moat)
让竞争对手很难抢走你客户的那道隔离带,可以是技术、品牌、数据、用户习惯,或者换平台太麻烦。
就像一家老字号饺子馆,配方保密、街坊邻居吃了三十年,你对门开个新店、装修再好,也很难在一年内把他的老客抢走。
真实案例Palantir 深度嵌入政府和军队的数据系统,帮助美国情报机构把海量数据整合到一套分析平台里。这些系统和客户的内部流程、数据格式强绑定,迁移成本极高——据报道他们的政府合同平均续约率非常高,正是因为换掉 Palantir 等于重建整套数据基础设施,客户根本不敢轻易换。
为什么重要没有护城河的生意是在平地上打仗,有护城河的生意是在城堡里等人来攻——两者的可持续性天差地别。
规模化(Scalability)
用户从一百增长到一百万,系统能撑住,成本不会等比暴涨,质量也不会垮。
就像一家外卖平台,接了一万单和接了一百万单,骑手调度系统还是那套系统,不用每多一单就多雇一个调度员。
真实案例OpenAI 在 2022 年底推出 ChatGPT 后,五天内用户破百万,两个月内破亿——这个速度历史上没有任何产品达到过。背后是微软 Azure 云基础设施支撑,让他们不需要在短期内手动扩建机房,只靠弹性云算力就消化了流量洪峰。如果没有可规模化的架构,这波热度会直接把服务器打趴。
为什么重要规模化是互联网和AI公司能「小团队撬动大业务」的根本原因,也是判断一个商业模式值不值得投的核心维度。
技能溢价(Skill Premium)
能用新技术、新工具的人比普通劳动者工资高出一大截,而且这个差距随着技术进步越拉越大。
就像装修队里,普通小工一天三百,但能看图纸、会用BIM软件做3D建模的那个人,一天至少八百,还供不应求。
真实案例AI 浪潮里,懂得用 Cursor、Claude Code 等 AI 编程工具的开发者,和只会传统写代码的同行,效率差距已经被业界广泛记录为「数倍以上」。科大讯飞等国内AI公司在招聘提示工程师和AI应用工程师时,薪资明显高于同级别传统岗位,正是技能溢价在企业端的直接体现。
为什么重要它解释了为什么学新技能比混年限更重要——市场在给「能用新工具的人」发奖金,不管你愿不愿意。
产业互联网/行业云
把云计算和AI能力专门为某个行业定制打磨,不是通用工具,而是「懂医疗/懂制造/懂金融」的专用系统。
就像找翻译——找一个什么都能翻的通用翻译,和找一个专门做医学文献翻译、熟悉所有专业术语的医学翻译,结果完全不同,行业云就是那个专科翻译。
真实案例腾讯医疗云把微信问诊、AI影像诊断、医院HIS系统整合到一起,专门服务医疗机构,而不是卖通用云服务器。类似地,国内月之暗面(Kimi)和智谱AI也在向金融、法律等垂直行业定制模型能力,据报道智谱AI的行业定制解决方案已覆盖政务、教育、工业等多个场景,而非只卖API接口。
为什么重要通用云只解决「存储和算力」,行业云解决「这个行业的具体业务怎么跑」——后者的壁垒更高,客户也更难离开。

未来趋势与就业 · 5 个概念

自动化替代
机器或AI能把人原来做的工作做掉,这部分人就不需要了——就这么简单。
就像以前超市收银台要十几个收银员,现在装了自助扫码机,只留两个人维护机器,其余的人就被「替代」了。
真实案例亚马逊仓库自2012年引入Kiva机器人后,分拣效率提升约3倍,同等吞吐量所需仓库工人数量大幅下降。不只是体力活,富士康2016年前后在昆山工厂用机器人替换了约6万名工人。据报道,麦肯锡研究估计全球约15%的现有工作任务在未来十年内具备被自动化的技术条件。
为什么重要它是「未来就业危机」讨论的源头——搞清楚哪些工作真的会消失,才能知道该往哪里跑。
技能迁移 Reskilling
你原来会的那套本事被时代淘汰了,重新学一套新本事继续养活自己,这个过程叫技能迁移。
就像老师傅以前靠修胶片相机吃饭,数码时代来了,他去学修数码设备,手艺换了但还是靠修东西过日子。
真实案例亚马逊2019年宣布「Upskilling 2025」计划,投入约7亿美元为旗下约10万名员工提供再培训,帮他们从仓库操作员、客服等岗位转型成云计算技术员、数据分析师。德国大众汽车也在电动化转型期间启动大规模技师再培训项目,让发动机装配工学习电池模组安装。
为什么重要当一整个行业的工作被机器吃掉时,Reskilling是避免大规模永久性失业的唯一出路——不是等政府救,是得真的学新东西。
人机协同 Augmentation
不是机器替换你,而是机器帮你把活干得更快更好,你还在,但能力被放大了好几倍。
就像装修师傅以前全靠手刨木头,现在拿电刨,一天能干以前三天的活,但还是他在做决定、看尺寸、把控质量。
真实案例法律AI公司Harvey已在Allen & Overy等国际律所部署,律师用它快速梳理合同、检索判例,原来查一份200页合同要几小时,现在十几分钟出初稿,律师负责最终判断和谈判。医学影像领域,AI辅助诊断工具(如Enlitic、科大讯飞医疗影像)能帮放射科医生在阅片时标记可疑区域,医生最终拍板,漏诊率据报道有明显下降。
为什么重要它解决了一个根本矛盾:AI不够可靠不能全权放手,但纯靠人又太慢太贵——人机协同是现阶段唯一落地的务实路径。
社会生产关系
一个社会里,谁拥有生产工具、谁出力干活、收益怎么分——这背后的权力和利益结构,就叫生产关系。
就像开餐馆,老板有店面和设备,厨师和服务员出工出力,最后利润大头归老板,这就是你们之间的「生产关系」。AI时代的问题是:当机器本身成了最大的「劳动力」,「老板」和「打工人」之间的分配会怎么变?
真实案例OpenAI从非营利组织转型为「利润上限公司」再到2024年讨论完全商业化,这场公司治理之争本质上是:AI产生的巨大价值应该归谁——股东、创始人、还是全人类?与此同时,据报道Klarna用AI客服替代约700名外包客服员工后,公司利润大幅增长,但这部分利润归了股东,而非被替代的劳动者。
为什么重要AI不只是技术问题,它在重新分配「谁获益、谁承担代价」——不搞清楚这个,所有「AI创造就业」的说法都只是半句话。
增强 vs 替代之争
AI到底是给你加buff让你变强,还是把你直接踢出局?这个问题到现在还没有定论,两派人吵得很凶。
就像计算器出来的时候,有人说会计要失业,结果会计反而变多了——因为算得快了,业务也变复杂了。但ATM机出来后,柜台出纳员确实少了不少。同一件事,结果可以完全不同。
真实案例「增强派」爱引用的是GitHub Copilot的数据:接入AI编程助手后,开发者完成任务速度据GitHub官方报告提升约55%,开发者并未大规模失业,需求反而增加。「替代派」则指向Chegg——这家在线教育公司2023年直接在财报里承认ChatGPT冲击导致新用户增长停滞,股价单日暴跌超40%。Salesforce CEO贝尼奥夫2024年更明确表示公司将暂停部分软件工程师招聘,因为AI可以替代这部分产出。
为什么重要这场争论决定了政策该怎么制定、你该怎么规划职业——如果是「增强」,努力学会用AI就够了;如果是「替代」,你得想清楚自己的不可替代性在哪。

中国大模型生态 · 6 个概念

大模型「六小虎」
中国 AI 圈对六家最有代表性的大模型创业公司的合称,它们是智谱、月之暗面、MiniMax、百川、零一万物、阶跃星辰。
就像餐饮圈说「北京四大烤鸭」——不是官方颁的牌子,是业内人士给最出名的一批选手贴的标签,方便一句话点出「这几家要重点关注」。
真实案例2023 年前后,中国大模型赛道融资井喷。月之暗面(Kimi)据报道在 2024 年完成了超过 10 亿美元融资,智谱 AI 背靠清华系技术积累推出 GLM 系列,MiniMax 旗下 Talkie 在海外社交 AI 用户量跑进全球前列。这六家被媒体反复提及,「六小虎」叫法由此约定俗成。
为什么重要帮你快速锁定中国大模型竞争格局里「值得持续跟踪的玩家」,省去自己从几十家里筛选的时间。
智谱 AI / GLM 系列
中国一家大模型公司,背靠清华大学计算机系,做的事就是训练能读懂、会写作的 AI 大脑,主打产品叫 ChatGLM,可以接 API 用到自己的软件里。
就像清华附近开了家顶配厨师学校,自己既出厨师(模型)又开餐馆(产品),还把菜谱(代码)分享给外面的人自己做着吃。
真实案例ChatGLM-6B 在 2023 年初开源后,被国内几百家企业直接拿去做内部知识库和客服机器人的底座。其企业级产品「智谱清言」面向 C 端,B 端则提供 API 平台,先后服务过央企、银行等政府相关机构。
为什么重要它是「六小虎」里少数既有顶级学术背书、又把模型开源给社区玩的公司,科研界和产业界都能接上头。
月之暗面 / Kimi
一家专门做「超长上下文」AI 对话产品的中国创业公司,旗下的 Kimi 聊天助手最大特点是能一次读完一本书甚至更长的内容再回答你。
就像你雇了个助手,别人的助手只能帮你看 5 页文件,Kimi 能把整份合同、整个项目报告一口气读完,再告诉你重点在哪。
真实案例Kimi 在 2024 年初把上下文窗口拉到 200 万 token,是当时全球公开可用产品里最长的之一。这一波「长上下文」营销让 Kimi 在国内白领圈迅速破圈,月活用户据报道数月内涨到千万级别,逼得国内同行纷纷跟进拉长自己的上下文窗口。
为什么重要证明了「在某一个能力维度做到极致」就能打出差异化,不用什么都比 GPT-4 强才能活下去。
MiniMax
一家主打「多模态 + 社交 AI」的中国大模型公司,既有自己的模型底座,又做了能跟 AI 虚拟角色聊天的 C 端产品。
就像一家既自己建厂造零件(基础模型)又直接开店卖成品玩具(角色扮演社交 App)的公司,上下游都自己做。
真实案例MiniMax 旗下的 Talkie(海外版)是一款让用户和 AI 虚拟角色互动的社交 App,2024 年在北美和东南亚用户量增长很快,据报道曾进入美国区 App Store 社交类前列。国内版本「星野」同样面向年轻用户。与此同时,MiniMax 也向 B 端开放 API,主打其在语音合成和多模态能力上的优势。
为什么重要它是「六小虎」里最早把大模型能力变成大众消费品的一家,证明了大模型不只能做企业工具。
行业大模型(垂直大模型)
专门针对某个具体行业(医疗、法律、金融、工业…)训练或微调的 AI 模型,懂行业黑话、会处理行业专属问题,不是什么都会一点的通用 AI。
就像全科医生和专科医生的区别——ChatGPT 是全科医生啥都能聊,行业大模型是只看心脏科的专科医生,在它那个领域比全科更准更靠谱。
真实案例科大讯飞推出「讯飞医疗大模型」,在部分医疗问答测试里准确率据报道超过了通用大模型。金融领域,彭博社推出 BloombergGPT(全球案例),国内平安、度小满等也推出了自己的金融大模型,主要用于风控、研报解读和智能客服。
为什么重要通用模型在专业场景容易「一本正经地胡说八道」,行业模型用专业数据喂出来,出错率低得多,企业才敢真的用在核心业务上。
信创与数据合规
「信创」是中国推动把 IT 底层(芯片、操作系统、数据库)换成国产的政策方向;「数据合规」是按《数据安全法》《个人信息保护法》等法律规定,确保数据的收集、存储、使用不违规。两件事放在一起,是大模型落地政府和国企绕不过的门槛。
就像你想在学校食堂卖盒饭,信创相当于「食材必须用本地供应商」,数据合规相当于「学生信息不能卖给外人」——两个都符合才能拿到经营许可。
真实案例2023 年《生成式人工智能服务管理暂行办法》落地后,国内大模型产品必须备案才能面向公众上线,训练数据不能含有违法内容。华为、浪潮等信创厂商借此打入大量政务大模型项目,因为政府采购明确要求用国产芯片和国产云;而 OpenAI、Anthropic 的 API 在中国政府系统几乎无法直接采购使用。
为什么重要对国内大模型公司来说,搞定信创和合规就等于拿到了政府和国企这块最肯花钱的客户群的入场券,忽视这两点就等于主动放弃最大的蛋糕。

FDE 与 AI 落地关键人物 · 6 个概念

Alex Karp(Palantir CEO)
把AI分析软件卖给政府和大公司的人,专门帮你从海量数据里找出隐藏规律,做决策用的。
就像一个超级侦探,你把所有监控录像、账单、日志全交给他,他帮你找出谁是幕后黑手。
真实案例Palantir最早帮美国情报机构追踪本拉登的资金流向,后来转型商业,2020年上市,市值一度超过400亿美元。他们的AIP平台是目前把大模型接入政府和军工落地最深的产品之一。
为什么重要证明了AI落地最难的不是算法,而是把数据、权限、流程全打通——他用了20年才让政府买单。
Bret Taylor(Sierra AI / 前Salesforce联席CEO)
做企业客服AI的实战派,专门帮公司把大模型变成真正能接电话、处理投诉、解决问题的客服机器人。
就像把一个聪明但嘴笨的大学生(大模型),培训成能独立接待顾客、处理退货的熟练店员。
真实案例Taylor离开Salesforce后创建Sierra,专注企业级AI Agent落地,客户包括Sirius XM、Weight Watchers等大品牌。Sierra的核心卖点是让AI客服能真正"办事",而不只是回答问题——可以查订单、退款、改预约。
为什么重要他填补了大模型会说话但不会干活的关键缺口,把对话变成了真实业务动作。
Andrej Karpathy(前特斯拉AI负责人/OpenAI联创)
教AI"看懂"世界的工程师,既主导了特斯拉自动驾驶的视觉系统,也是全球最受欢迎的AI科普教育者之一。
就像一个教练,他不只自己打球,还把训练秘籍录成视频免费发出去,让几十万人学会了同样的技术。
真实案例Karpathy在特斯拉主导的纯视觉自动驾驶方案(去掉雷达)至今仍有争议但已量产。他在YouTube上发布的《Neural Networks: Zero to Hero》系列课程,据报道累计播放量超千万,带出了一批直接进入AI公司的工程师。
为什么重要他证明了深度技术完全可以通俗化,顺带把AI工程师的入门门槛降低了一个量级。
Aravind Srinivas(Perplexity CEO)
做"会答题的搜索引擎"的人,让你问问题直接得到有来源的答案,而不是给你一堆链接自己去找。
就像你问朋友"哪家餐厅好",朋友不是给你一张地图,而是直接告诉你:"虹桥那家川菜,上周去的,人均80,排队20分钟值得。"
真实案例Perplexity成立于2022年,据报道2024年估值超过30亿美元,日查询量达数千万级。它在AI搜索赛道上直接挑战Google,微软必应、谷歌均在同期推出AI搜索回应竞争,整个搜索行业因此被迫重构产品逻辑。
为什么重要他让人们第一次感受到:搜索引擎可以不给链接,AI直接替你读完再告诉你结论。
梁文锋(DeepSeek创始人)
用比别人少得多的钱,训练出跟顶级大模型比肩的AI,把全球AI军备竞赛的成本预期直接打穿了。
就像别人开豪华酒店要10亿,他用1个亿开出了同级别服务的连锁品牌,还把装修图纸全公开了。
真实案例DeepSeek R1于2025年初发布,据业界广泛报道,其训练成本约为同级别美国模型的十分之一。发布后直接引发英伟达股价单日暴跌约17%(约6000亿美元市值蒸发),成为AI史上最具冲击力的开源事件之一。
为什么重要他打破了"只有花大钱才能做好AI"的神话,让中小团队相信高性能模型不再是巨头的专利。
杨植麟(月之暗面/Kimi创始人)
做超长记忆AI的人,让大模型能一次性读完一本书甚至整个代码库,再回答你的问题,不会忘事。
就像普通店员只能记住你今天点的菜,而他培训出来的店员能记住你过去三年每次来都点了什么,口味偏好全在脑子里。
真实案例月之暗面旗下的Kimi是国内最早把上下文窗口做到200万token量级的产品,一度引发国内AI产品的"长文本军备竞赛"。公司于业界普遍报道中估值超过百亿人民币,是国内增长最快的AI应用之一。
为什么重要他把"AI健忘"这个落地最大的痛点正面突破,让企业级长文档处理场景第一次变得真实可用。

AI 落地里程碑事件 · 6 个概念

2022 ChatGPT 发布
一个能像真人一样聊天、写文章、回答问题的 AI 助手,普通人直接用网页就能对话,不需要会编程。
就像以前打车要打电话给出租车公司排班,突然有了滴滴——人人都能直接叫车,门槛从专业变成了零门槛。
真实案例OpenAI 于 2022 年 11 月 30 日上线 ChatGPT,5 天内用户突破 100 万,2 个月后突破 1 亿,成为史上增长最快的消费级应用。谷歌随即内部宣布「红色警报」,微软紧急追加对 OpenAI 的投资。此前 AI 被认为是「科学家的玩具」,从这一刻起变成了每个人桌上的工具。
为什么重要把 AI 的使用门槛从「会写代码」降到了「会打字」,让亿级普通用户第一次真正摸到了 AI。
2023 GPT-4 与展开应用
比 ChatGPT 强得多的升级版,能看懂图片、通过律师考试,聪明程度飞跃式提升,并被微软、法律科技公司相继嵌入商业产品。
就像从自动挡练习车升级到了特斯拉 Model S——还是「会开」的门槛,但性能和上限完全不同。
真实案例2023 年 3 月,OpenAI 发布 GPT-4,它在美国律师资格考试中排名前约 10%,而 GPT-3.5 只排在后 10%。微软将 GPT-4 嵌入 Office 全家桶(Copilot),法律 AI 公司 Harvey 随即以其为底层拿下多家顶级律所合同。AI 落地全面应用的大门正式打开。
为什么重要证明了 AI 不只是「能聊天」,在专业领域开始接近甚至超过人类水平,打开了企业级落地的想象空间。
Palantir AIP 上线
一套把大语言模型接进企业内部真实数据和流程的操作平台,让 AI 不只回答问题,还能直接操控公司系统干活。
就像给新来的聪明实习生办了门禁卡和操作权限——他不再只是在会议室给建议,而是能直接进仓库搬货、登系统下单。
真实案例Palantir 于 2023 年 4 月发布 AIP,将 GPT 等大模型与企业私有数据、作战系统、供应链系统打通。在公开 Boot Camp 演示中,军事人员用自然语言指挥 AI 实时调配无人机侦察,全程无需写一行代码。Palantir 股价在 2023 年全年涨幅据报道超过 160%,成为企业 AI 落地最具代表性的标杆。
为什么重要第一次让业界看清「AI 落地」的完整闭环:不是聊天机器人,而是能接管真实业务流程的操作入口。
2024 MCP 开源
Anthropic 发布的一套通用接口标准,让 AI 能像插 USB-C 一样统一对接各种工具、数据库和应用,不用每次重新写接口。
就像家电从各家私有充电口统一换成了 USB-C——以前每个品牌一根线,现在一根线走天下,厂商和用户都省事。
真实案例Anthropic 于 2024 年 11 月开源 MCP(模型上下文协议)。数周内 Zed、Replit、Codeium 等开发工具以及 Slack、GitHub 相继宣布支持。到 2025 年初,MCP Server 生态已有数百个开源实现,开发者无需重复造轮子即可让 AI 接管文件、数据库等几乎所有工具。
为什么重要解决了 AI 与工具「互不说话」的碎片化问题,让 Agent 从概念变成了可大规模复用的工程实践。
DeepSeek-R1 时刻
中国团队用极低成本训练出了推理能力媲美当时美国顶级模型的 AI,并完全开源,震动全球 AI 圈。
就像一家小餐馆用家常灶台做出了米其林三星级的菜,还把菜谱贴到网上免费让人抄——让靠贵重设备垄断的大厨们集体坐立难安。
真实案例2025 年 1 月,深度求索发布 R1 模型,在数学、代码等推理基准上与 OpenAI o1 持平,据报道训练成本不到同类模型的十分之一。发布当天英伟达市值单日蒸发据报道约 5000 亿美元。全球 AI 社区掀起「高效训练」热潮,重新评估了算力军备竞赛的判断逻辑。
为什么重要打破了「顶级 AI 必须靠天价算力堆出来」的认知,把大模型能力的门槛大幅拉低,重塑了整个行业的成本预期。
Computer Use 与 Manus:AI 自主行动时代
AI 能像真人操作电脑、独立完成多步骤复杂任务,不需要人全程盯着,你给目标它自己搞定。
就像以前得手把手教助理一步步点击,现在你只说「帮我把这张报销单填完提交」,助理自己看着屏幕就搞定。
真实案例Anthropic 于 2024 年 10 月随 Claude 3.5 Sonnet 发布 Computer Use,让 AI 能直接操控桌面应用。 2025 年 3 月 Monica 团队发布 Manus,这个「通用 AI Agent」发布后邀请码在二手平台被炒到据报道数百元。国内外科技媒体将其称为「Agent 元年」的标志性产品,随后智谱、字节、百度等公司相继加速推出类似 Agent。
为什么重要让 AI 冲出「对话框」局限,开始能替人「动手」完成复杂任务,宣告 AI 从工具进化为「同事」的时代正式开启。

新锐 AI 公司速览 · 6 个概念

Cursor / Anysphere
给程序员用的 AI 代码编辑器,写代码时 AI 帮你补全、改 bug、解释逻辑,像有个老手坐你旁边随时答疑。
就像请了个资深厨师站在你旁边,你切菜时他帮你指哪里切不对、缺什么调料,随时提示。
真实案例Cursor 由 Anysphere 团队打造,2024 年初在程序员圈子口耳相传,据报道年化营收突破 1 亿美元,速度超过历史上几乎所有 SaaS 产品。OpenAI 内部工程师据悉也在大量使用,被戏称为「连 AI 公司自己都在用的 AI 编程工具」。
为什么重要把需要搜索十几个网页才能解决的编程问题,压缩成在编辑器里几秒钟完成。
Cognition / Devin
一个能自己接任务、自己写代码、自己测试、自己修 bug 的 AI 软件工程师,人只需要提需求。
就像你发了个装修需求单出去,工人自己买材料、量尺寸、施工、收尾,你只看最终结果。
真实案例Cognition 2024 年推出 Devin,演示视频里 Devin 独立完成了一个完整的软件开发任务,震动了整个技术圈。据报道公司估值迅速跻身独角兽级别。但随后不少工程师实测后反映真实能力与演示有落差,引发了关于「AI 替代程序员」的广泛讨论。
为什么重要首次让外界相信 AI 不只是辅助工具,而是可能直接替代部分初级工程师岗位。
Perplexity
一个能直接给出答案并标注来源的 AI 搜索引擎,不用你自己去逐条点链接筛信息。
就像点外卖时平台帮你比完所有餐厅、筛出最合适的那家,而不是把几十家菜单全甩给你自己看。
真实案例Perplexity 上线后迅速积累数千万月活用户,被视为对 Google 搜索的直接挑战。谷歌随即加速推出自家 AI Overview 功能,业界普遍认为正是 Perplexity 的爆红逼出了谷歌的防御性动作。
为什么重要把「搜索 + 阅读 + 总结」三步合并成一步,大幅降低获取信息的成本。
Replit
一个在浏览器里就能写代码、运行程序、部署上线的云开发平台,不用在自己电脑装任何东西。
就像不用自己买厨具、不用租厨房,直接在美食广场的公共档口点一个摊位就开始做菜卖饭。
真实案例Replit 2024 年在编辑器中深度整合 AI 能力,推出「Replit Agent」,能让没有编程基础的人说一句话就生成并部署一个可用的 Web 应用。据报道其用户量已超千万,大量非技术创业者用它快速验证产品想法。
为什么重要把「有想法但不会写代码」这个门槛近乎拆掉,让软件开发变成人人可及的事。
Together AI
一个专门帮你便宜快速地调用各种开源 AI 大模型的云平台,不用自己买显卡、搭环境。
就像共享厨房,你想用哪个名厨的炉灶就按小时租,不用自己买设备养厨师。
真实案例Together AI 主打开源模型推理加速,支持 Llama、Mistral、Qwen 等主流开源模型,价格比 OpenAI 官方 API 低数倍。大量国内外初创公司和研究团队用它作为快速原型验证的基础设施,避免了采购 GPU 集群的高额前期投入。
为什么重要让中小团队也能以极低成本使用顶级开源模型,把算力门槛从「百万级资本」压到「信用卡即开即用」。
Mistral AI
一家法国 AI 公司,专门做性能强、体积小、可本地部署的开源大模型,是欧洲对抗美国 AI 巨头的代表力量。
就像精品手工啤酒厂:不跟百威比产量,靠配方精准、可以带回家自酿来赢得专业玩家。
真实案例Mistral 2023 年由前 Google DeepMind 和 Meta AI 研究员创立,第一个模型 Mistral 7B 发布后震惊业界,以极小体积达到远超同量级模型的效果。公司随后获得约 6 亿欧元融资,估值据报道超 60 亿美元,成为欧洲 AI 领域最受关注的独角兽之一。
为什么重要证明了「小而精」的开源模型路线可行,给不想被 OpenAI 或谷歌锁定的企业提供了真实可用的替代方案。

企业 AI 采购黑话 · 6 个概念

POC(概念验证)
花最少的钱和时间,先做一个能跑通的小样品,证明这个技术方向不是白日梦。
就像装修前先买一小块瓷砖贴在墙上看颜色对不对,不是上来就买几百片。
真实案例2022年,Glean在向一家大型咨询公司推销企业知识库搜索时,用两周时间接入客户约500份内部文档跑了一个POC演示。客户工程师当场搜到了埋在PDF里的规定,决策链路直接缩短三个月。
为什么重要帮买卖双方在花大钱之前,用最低成本确认「技术上能不能做到」。
Pilot(试点)
POC证明能跑通之后,找一个真实的小部门或小场景真刀真枪地用,看看在现实里有没有问题。
就像连锁餐厅新菜品先在一家门店卖一个月,卖得好再全国铺。
真实案例科大讯飞在向银行推广AI客服时,通常先在一个地区分行的人工座席旁做「副驾驶」试点,业界普遍跑3-6个月收集真实通话数据,再决定是否全行推广。
为什么重要帮买方在真实业务压力下验证「用得起来不」,比POC更接近真相。
RFP(招标/征求建议书)
甲方把自己的需求、预算、评分标准写成一份文件,发给多家供应商,让他们来投标比价。
就像你装修时发布需求帖:「三居室,预算20万,要包工包料,请各装修公司报价。」
真实案例美国联邦政府2023年采购生成式AI辅助工具时发出多份RFP,Palantir、Booz Allen Hamilton等公司都参与投标,整个流程从发标到定标历时数月,合同金额据报道从数百万到数亿美元不等。
为什么重要让甲方通过竞争拿到最合适的方案和价格,而不是被第一个上门的销售牵着走。
SLA(服务等级协议)
供应商白纸黑字承诺服务质量的底线:系统宕机不超过多少小时、响应时间不超过几秒、出问题几小时内必须修好,违反了要赔钱。
就像外卖平台承诺「超时必赔」——30分钟没到就退券,这就是对骑手和商家的SLA。
真实案例OpenAI的企业版ChatGPT在SLA上比免费版严格得多,据其官方文档承诺API可用性达到业界普遍的99.9%标准;Azure OpenAI服务的SLA则与微软云基础设施绑定,宕机时间直接影响赔付计算。
为什么重要把「我们尽力」变成「做不到就赔钱」,让供应商有动力真正保证稳定性。
TCO(总拥有成本)
买AI不只看标价,还要把实施费、培训费、运维费、迁移费、失败风险全部加进去,算出真正要花多少钱。
就像买车不只看裸车价,还得算上保险、油费、保养、停车费,这才是养这辆车的真实成本。
真实案例Palantir在和政府客户谈判时,经常用TCO分析来对抗「自研更便宜」的质疑——把客户自研所需的工程师人力、基础设施、安全审计、持续维护成本全部列出来,业界案例显示自研TCO往往是SaaS采购价的数倍。
为什么重要防止被低报价套住,签合同前算清楚,避免用了一年才发现隐性成本远超预期。
SOW(工作说明书)
合同里最具体的那张清单:这次要做什么、谁来做、做到什么程度、什么时候交付、交什么东西。
就像装修合同里那页详细报价:「客厅刷乳胶漆两遍,用X品牌,含工含料,10月1日前完工,验收标准是无色差无起皮。」
真实案例Harvey(AI法律助手)在和律所签约时,SOW会明确标注:提供多少个并发席位、数据留存多久、每月响应时间上限是多少,以及哪些司法管辖区的法律文件在覆盖范围内。
为什么重要把口头承诺变成可追责的文字,出了问题有据可查,不会扯皮说「当时说的不是这个意思」。

AI 工程进阶名词 · 6 个概念

Context Engineering 上下文工程
给 AI 精心打包它需要知道的所有背景信息,让它每次回答都像个刚被完整交接过的老员工,而不是什么都不知道的新人。
就像给代班厨师写一份交接本:今天点了哪些菜、客人有什么忌口、昨天剩了什么食材——写得越详细,饭菜越对口。
真实案例Glean 帮企业搭内部知识搜索,最核心的活就是上下文工程:把员工的问题、部门、权限、历史对话一起塞给大模型,让它只回答「这个人该知道的事」。业界普遍认为,上下文工程的质量比模型选型更影响企业 AI 落地效果。
为什么重要解决了「AI 答非所问」的根本原因——不是模型笨,是没给够信息。
Prompt Caching 提示缓存
把每次都要重复发给 AI 的那段超长背景文字存起来,下次直接复用,不用再烧一遍钱。
就像点外卖时把常用地址存进收藏夹,每次不用重新打一遍,直接选。
真实案例Anthropic 2024 年给 Claude 上线了 Prompt Caching,官方数据显示缓存命中时成本可降约 90%、延迟也大幅缩短。Harvey 这类把法律合同(动辄几万字)反复喂给 AI 的法律科技公司,是最直接的受益者——同一份合同只需付一次全价。
为什么重要解决了「每次对话都要重新交学费」的浪费,让 AI 在长文档场景下便宜到可以规模化。
KV Cache
AI 生成文字时,把已经算过的内容的「计算结果」存下来,后续接着生成时直接取用,不重算。
就像厨师备菜时提前把葱姜蒜切好放在碗里,炒每道菜不用临时再切,直接抓来用。
真实案例vLLM 是加州大学伯克利分校开源的推理框架,其核心创新「PagedAttention」本质上是用操作系统内存分页的思路管理 KV Cache,让 GPU 显存利用率大幅提升,吞吐量据报道可比原生高出数倍,被 Mistral、月之暗面等大量厂商采用。
为什么重要解决了「生成每个字都要从头重算」的低效,让 AI 回复又快又省显存。
MoE 混合专家 (Mixture of Experts)
一个大模型里住着很多「专科小模型」,每次来了问题只叫醒其中几个最对口的专家来回答,其他人继续睡觉。
就像医院的专科门诊——挂号后系统根据你的症状只叫内科或骨科,不是把全院医生都喊来会诊。
真实案例DeepSeek-V3 是 MoE 架构的代表作,总参数约 671B,但每次推理只激活约 37B,算力消耗远低于同量级密集模型。2025 年初它以极低训练成本发布,在多个榜单追平顶级闭源模型,震动了业界对「烧钱才能做好模型」的固有认知。
为什么重要解决了「大模型太贵跑不起」的问题,让超大规模模型的推理成本降到可商业化的程度。
Speculative Decoding 推测解码
用一个又小又快的草稿模型先猜后面几个词,再让大模型批量验证对不对——猜对了直接用,等于白赚了速度。
就像助理先根据老板风格起草一封邮件,老板扫一眼批「这三段都对,第四段改一下」——比老板从零写快多了。
真实案例Google 在 Gemini 的推理链路中大量使用推测解码,DeepMind 的论文显示该技术可在不损失输出质量的前提下将生成速度提升约 2-3 倍。Groq 的 LPU 芯片架构也将推测解码作为提速核心,让其在公开测试中跑出了业界最快的 token 生成速率。
为什么重要解决了「大模型回复慢、用户等得不耐烦」的体验问题,且完全不牺牲回答质量。
蒸馏 Distillation
让大模型(老师)做大量题并留下答案,小模型(学生)只学这些答案,而不是从零学习——小模型因此远超其体量应有的能力。
就像让学霸把做题思路全录成视频,普通学生反复刷视频——比自己闷头做题进步快得多。
真实案例DeepSeek-R1 发布时同步开源了用其推理结果蒸馏出的多个小模型,其中蒸馏版 Qwen-7B 在数学推理上的表现据报道接近原版 GPT-4 水准。斯坦福的 Alpaca 项目更早就用 GPT-3.5 的输出蒸馏出一个成本极低的开源模型,证明了蒸馏路线的可行性。
为什么重要解决了「小公司/个人用不起大模型」的卡脖子问题,让优质能力得以下沉到消费级硬件上运行。

数据隐私与安全 · 6 个概念

私有化部署
把AI或软件系统装进自己的机房/服务器里跑,数据不出门,全程自己管。
就像不去外面餐厅吃饭,而是把厨师和厨房整个搬进自己家——菜谱、食材、做法全在自己眼皮底下。
真实案例某大型国有银行采购科大讯飞语音识别时,合同要求模型必须部署在银行内网,外网断连也能用。类似地,政务云项目普遍要求「不过外网一个字节」,厂商必须交付整套离线包。
为什么重要解决了「数据上了云就不知道去哪儿」的根本焦虑,把控制权还给数据所有人。
联邦学习
多家机构各用自己数据训练模型,只把「学到的经验」汇总,原始数据一条都不出门。
就像各地厨师各自在自家厨房练刀工,每周只把「心得体会」传到总部汇编成教材——菜本身从不离开厨房。
真实案例Google 在 2017 年用联邦学习改进 Gboard 手机键盘输入预测:全球数亿台手机各自本地训练,只上传梯度更新,用户的打字习惯从未上传服务器。微众银行也用此技术让多家银行联合建风控模型,却互不泄露客户名单。
为什么重要解决了「数据不共享就无法联合建模」的两难——数据不动,智慧流动。
差分隐私
往数据里加一点数学噪音,让任何人都无法从统计结果反推出某个具体人的信息。
就像公司发薪资调查报告时,故意把每人数字随机加减几百块再统计——平均数还是准的,但你猜不出具体哪个同事拿多少。
真实案例Apple 从 iOS 10 开始在 Emoji 使用频率、Safari 崩溃统计等数据收集中内置差分隐私,对外宣称「我们收集数据但无法识别到个人」。美国人口普查局在 2020 年人口普查中首次全面采用差分隐私,防止通过公开数据反查具体家庭信息。
为什么重要解决了「发布统计数据 = 泄露个人隐私」的矛盾,让数据可用但不可追溯。
数据脱敏
把真实数据里的敏感信息替换成假的或打码,外形和格式保留,不违法使用不泄露真实身份。
就像剧组拍摄时道具钱包里放的是假钱——外形一模一样,能演戏,但小偷偷走了也没用。
真实案例国内某头部互联网公司的开发测试环境,每天从生产库同步数据时,用户真实手机号全部替换为格式相同的随机号,让开发者能正常调试却看不到任何真实用户信息。这是 GDPR 和等保 2.0 的强制要求之一。
为什么重要解决了「开发测试必须用真数据但真数据不能随便给」的工程现实矛盾。
RBAC 基于角色访问控制
按岗位而不是按人分配权限——你是什么角色就能看什么数据,换岗位权限自动跟着变。
就像酒店的门禁卡:前台员工的卡能开大厅和仓库但进不了财务室;经理的卡多开一个财务室。换人入职直接发对应级别的卡。
真实案例Salesforce 的权限体系是 RBAC 的经典实现:销售代表只能看自己名下的客户,销售总监能看全部门。企业搜索 AI Glean 也把 RBAC 作为核心卖点,确保员工搜索公司知识库时只能搜到自己权限内的文件。
为什么重要解决了「人一多权限乱成一锅粥、离职忘撤权」的管理地狱。
最小权限原则
任何人、程序、系统,只给完成当前任务「刚好够用」的权限,多一点都不给。
就像给装修工人配的门禁卡只能进施工楼层,不能进其他住户房间——活干完了卡就收回,下次来再发。
真实案例2020 年 SolarWinds 供应链攻击中,黑客之所以能横向渗透进数千家机构,部分原因正是 SolarWinds 的更新服务运行在过高权限下。事后美国 CISA 发布指南,将「最小权限」列为零信任架构首要原则。Palantir 也以细粒度权限管控作为对政府客户的核心承诺。
为什么重要解决了「一个账号被攻破全盘皆输」的连锁崩溃风险。

模型评估细节指标 · 6 个概念

准确率 / 召回率 / F1
准确率是「你说对的里有多少真的对」,召回率是「真正对的里你抓住了多少」,F1是两者的综合得分,防止偏科。
就像用筛子捞金子:准确率是「筛出来的里有多少是真金」,召回率是「矿里的真金你捞出来多少」,F1让你不能只靠宽网乱捞、也不能只靠细网空筛。
真实案例Harvey AI 给律师做合同审查时,召回率至关重要——漏掉一条风险条款比多标几条「假风险」代价大得多。业界普遍认为法律/医疗场景应优先保召回率,宁可多报也不能漏,这直接影响 Harvey 如何设定模型阈值。
为什么重要一个指标藏不住偏科,三个指标合用才能让模型既不乱报警、也不失职漏报。
困惑度 Perplexity
模型看到一段文字,有多「懵」——越懵分数越高,越胸有成竹分数越低。衡量的是模型预测下一个词有多准。
就像让外卖小哥在陌生小区找门牌号:他对这片越熟,猜错路口的次数越少,「困惑度」就越低;头一次来的小哥到处乱转,困惑度爆表。
真实案例Meta 发布 LLaMA 系列时,官方报告里大量使用 Perplexity 对标 GPT-3 和 PaLM。LLaMA-65B 在 WikiText-103 上困惑度约 3.56,低于当时 GPT-3 的数值,这成为「小模型可以打败大模型」叙事的核心数据支撑。
为什么重要不用人工打分就能快速衡量语言模型的基础语言能力,是训练过程中最廉价的「体检指标」。
幻觉率
模型一本正经地编出根本不存在的事实——假引用、假人物、假数据——这种「说谎」现象的发生比例。
就像一个永远不说「我不知道」的导游,没去过的景点也能讲得绘声绘色,而且日期、名字全是编的,但语气跟亲眼所见一样笃定。
真实案例2023年美国律师 Steven Schwartz 用 ChatGPT 写诉状,模型编造了六个根本不存在的案例引文,全部被法官发现,律师被罚款并公开道歉。此事直接推动 Harvey、Lexis+ AI 等法律 AI 公司把幻觉率压制列为头号工程优先级。
为什么重要幻觉率高的模型用在专业场景等于定时炸弹,量化它才能决定模型是否可以「上岗带业务」。
BLEU / ROUGE
机器翻译或摘要生成后,用「重叠词汇有多少」来打分——跟标准答案的词越像得分越高,不用人工逐句评判。
就像餐厅对照「标准菜谱」验收学徒做的菜:数一数用了几种规定食材,食材重合越多分越高——但不管味道好不好,也不管有没有用标准答案里没有的更好食材。
真实案例谷歌翻译早期迭代靠 BLEU 分数驱动优化,从统计翻译切换到神经网络后,BLEU 分数大幅提升;但用户反馈口语化表达反而更生硬,暴露出「BLEU 高不等于翻译好」的经典矛盾,促使行业后来引入更多人工评估。
为什么重要提供了不依赖人力的自动化评分方案,让每天跑几百次实验成为可能,是 NLP 工程的「流水线质检仪」。
人工偏好评估
让真人来判断「A回答和B回答哪个更好」,收集偏好投票来衡量模型质量——用人的感受代替机器打分。
就像新品奶茶上市前做「盲测」:不告诉顾客哪杯是哪个品牌,让他们喝两口选更好喝那杯——销量预测比任何仪器检测都准。
真实案例Anthropic 训练 Claude 时大量使用 RLHF(基于人类反馈的强化学习),雇用数千名标注员对模型回答两两比较打偏好分。OpenAI 的 InstructGPT 论文披露,这套方法让 13 亿参数的模型在人工偏好评估中胜过 1750 亿参数的原始 GPT-3,证明「对齐比规模更重要」。
为什么重要机器指标量不出「有没有帮到人」,人工偏好评估是目前最接近「真实用户满意度」的评估方式。
基准泄漏 Benchmark Leakage
模型在训练数据里「见过」考题,结果考试成绩虚高——像提前背了答案的学生,看起来很聪明,实际上是作弊。
就像期末考前老师不小心把原题发到班群里,全班平均分暴涨——校长以为教学质量提升了,其实学生只是提前看了答案,换一套新题又全部原形毕露。
真实案例2024年业界广泛讨论多个知名排行榜的「污染」问题,有研究发现部分开源模型在 MMLU 等主流基准上的高分,部分来自训练语料与测试题的重叠。Hugging Face 随后推出 LightEval 等工具专门检测污染,OpenAI 也声称会定期轮换内部评测集以对抗泄漏。
为什么重要泄漏会让排行榜失真、选型决策失准,识别并防范它是让模型评测真正有参考价值的前提。

智能体标准与协议 · 6 个概念

A2A (Agent2Agent)
两个AI智能体之间互相传消息、分配任务、协同完成工作的通信协议,就像两个机器人员工之间的对讲机规范。
就像两家不同快递公司的快递员,用同一套暗语接力送包裹:「你跑第一段,我跑最后一公里」,而不用管对方内部怎么运作。
真实案例Google 2025年发布 A2A 协议开源规范,目标是让不同公司开发的 AI Agent 能直接对话协作。业界普遍认为这是继 MCP 之后,多智能体系统互通的关键基础设施,Salesforce、SAP 等数十家企业已宣布支持接入。
为什么重要解决了「各家 Agent 自说自话」的孤岛问题,让不同厂商的智能体像乐高一样拼在一起干活。
Computer Use
AI 直接操控电脑屏幕——看截图、移动鼠标、点按钮、填表格,像人类员工一样用任意软件,不需要专门接口。
就像雇了一个从不抱怨的实习生,你把电脑屏幕对准他,他自己看着屏幕把活儿干完,不管是 Excel 还是政府网站。
真实案例Anthropic 2024年10月随 Claude 3.5 Sonnet 推出 Computer Use 功能,这是业界首个商用级「屏幕操控 AI」。据报道,早期测试中 AI 能自主完成订机票、填报销单等全流程任务,无需企业为每个旧系统单独开发 API。
为什么重要解决了「老系统没有 API,AI 没法用」的死结——只要人能用鼠标键盘操作的软件,AI 都能接管。
OpenAPI 规范
一套用来描述「这个网络接口能干啥、怎么调用、返回什么」的标准格式文件,是 API 的说明书模板。
就像麦当劳的标准菜单格式:每道菜都列名字、配料、价格、备注选项,全国所有门店格式一致,收银系统直接读懂。
真实案例OpenAPI 规范(前身 Swagger)目前是业界事实标准,全球据报道超过数亿个 API 使用这套格式。OpenAI 的 ChatGPT Plugins 和 Custom GPT Actions 直接用 OpenAPI 文件让 AI 认识第三方服务,开发者上传一个 yaml 文件,AI 就能学会调用你的接口。
为什么重要解决了「AI 不知道你的接口怎么用」的问题——有了这份标准说明书,AI 能自动理解并调用任意 API。
JSON Schema 结构化输出
强制要求 AI 返回指定格式的数据(比如必须包含姓名、年龄、分数字段),而不是一大段散文,方便程序直接读取。
就像让员工填表而不是写作文:「姓名__,部门__,离职原因__」,每格有固定位置,系统自动录入,不用再人工解析。
真实案例OpenAI 2024年8月正式发布 Structured Outputs 功能,保证 GPT-4o 100% 按照给定的 JSON Schema 输出,之前开发者要靠「玄学提示词」逼 AI 输出 JSON 经常失败。Anthropic Claude 同期也推出工具调用强制结构化,让 AI 输出直接进数据库成为可能。
为什么重要解决了「AI 说的话程序读不懂」的问题——把 AI 回复变成机器能直接处理的数据,而不是人工再解析一遍。
工具注册 (Tool Registration)
提前告诉 AI「你有这些工具可以用:查天气、发邮件、搜数据库」,AI 知道有这些能力后,会在需要时主动调用,而不是光靠自身知识回答。
就像给新厨师列一张厨房设备清单:「冰箱、烤箱、炸锅都在这,各自怎么开」——厨师自己决定做菜时用哪个,你不用每次指挥他。
真实案例Anthropic 的 Model Context Protocol (MCP) 是目前最受关注的工具注册标准,2024年底开源后迅速获得 Cursor、Windsurf 等数十个开发工具接入。智谱 AI、月之暗面等国内大模型厂商也相继推出兼容 MCP 的工具注册体系,让 AI 能连接本地文件、数据库、代码执行环境。
为什么重要解决了「AI 只会说不会做」的问题——注册工具后,AI 从问答机器变成能真正执行任务的智能体。
ReAct 变体
让 AI 边想边做的思考框架:先推理要干什么,再行动,看看结果,再推理下一步,循环往复直到任务完成,而不是一次性给出答案。
就像厨师炒菜:先想「要放盐了」(推理),放盐(行动),尝一口(观察),再想「还差点醋」(再推理),如此循环,不是一开始就把所有调料全倒进去。
真实案例ReAct 框架源自普林斯顿大学 2022 年论文,后来被 LangChain 大规模推广,成为 Agent 开发的主流范式。OpenAI o1/o3 的「思维链」、Anthropic Claude 的「扩展思考」以及 DeepSeek-R1 都是 ReAct 思想的演进变体,业界普遍认为这类「慢思考」模式让复杂任务准确率大幅提升。
为什么重要解决了「AI 一步答错全盘皆输」的问题——拆成小步走、边走边校正,复杂任务不再靠蒙。

创业财务指标 · 6 个概念

CAC 获客成本
花多少钱才能拉来一个新客户。包括广告费、销售工资、市场活动等,除以同期新增客户数。
就像开奶茶店发传单,发了1000张、花了500块,来了5个新顾客,每个顾客的CAC就是100元。
真实案例Glean(企业搜索SaaS)早期主要靠销售团队地推拿下大客户,据业界估算其企业级CAC高达数万美元——但只要客户签3年合同,这笔钱就值得。正是因为CAC太高,他们把获客重心从中小企业转向财富500强,整体效率才跑通。
为什么重要知道CAC才能判断「花这笔钱值不值」,它是衡量增长效率最核心的起点。
Payback 回本周期
花了CAC那笔钱,要多少个月靠这个客户赚回来。月数越短,说明生意越健康。
就像装修一个门店花了10万,每月净赚2万,那Payback周期是5个月——5个月后才开始真正赚钱。
真实案例Salesforce早年Payback周期据报道超过24个月,投资人照样买账,因为续约率极高、客户几乎不跑。但同类SaaS公司若Payback超18个月又续约率平平,通常会被认为模式有问题。业界普遍认为消费级产品Payback应在12个月以内,企业级可宽松到18-24个月。
为什么重要烧钱换增长能不能持续,Payback周期给了最直接的答案。
Burn Rate 烧钱率
公司每个月净亏多少钱、烧掉多少现金。收入不够覆盖支出的差额就是Burn Rate。
就像你手里有10万块生活费,每个月花12000、收入只有3000,净烧9000块——这个9000就是你的月Burn Rate。
真实案例OpenAI据报道2023年月烧钱率一度高达约8500万美元,靠微软135亿美元投资续命。但同年GPT-4带动收入暴增,Burn Rate压力才大幅缓解。这个案例说明:高Burn Rate本身不致命,关键是收入增速能不能追上。
为什么重要Burn Rate决定你还能活多久——不知道这个数,融资和招人都是在赌命。
Runway 现金跑道
按现在的烧钱速度,账上的钱还能撑几个月。是公司离「弹尽粮绝」还有多远的倒计时。
就像飞机跑道,油箱里还有多少油决定你能飞多远——油耗太猛或者油量不足,就得马上找地方降落(融资或砍成本)。
真实案例硅谷有句话:「Runway低于6个月就要全员融资模式」。月之暗面(Moonshot AI)前身团队据报道在融资前只有数月Runway,创始人杨植麟在极短窗口内完成A轮。Runway不够的公司往往在谈判桌上被迫接受极差的估值条款。
为什么重要Runway是生死线,直接决定创始人有没有资格在谈判桌上说「不」。
ARR / MRR
ARR是年度经常性收入,MRR是月度经常性收入。专指客户订阅续费带来的稳定收入,一次性收入不算。
就像房东收租:每月固定到账的租金是MRR,乘以12就是ARR——不是卖房子那种一锤子买卖,是每月躺着收的钱。
真实案例Harvey(AI法律助手)2023年据报道ARR突破约1000万美元,随后估值升至逾10亿美元。Anthropic的Claude API企业订阅也以ARR为核心指标衡量商业化进度。投资人给SaaS公司估值,通常直接用「N倍ARR」作为起点,ARR成了定价锚点。
为什么重要ARR/MRR把「收入是否可预期、可持续」这件事数字化,是SaaS估值最重要的单一指标。
Gross Margin 毛利率
每赚1块钱里,扣掉直接成本(服务器、人工交付等)之后还剩多少。剩得越多,模式越轻。
就像煎饼摊,一个煎饼卖10块,面粉鸡蛋燃气料加起来3块,毛利率就是70%——剩下的7块才是真正用来养活摊主和交摊位租金的。
真实案例Palantir毛利率常年维持在约80%,因为核心是软件平台、边际成本极低。相比之下,科大讯飞硬件+软件混合业务毛利率约40-50%,差距来自硬件物料成本。AI大模型公司(如OpenAI)早期毛利率被算力成本压得很低,据报道曾低于50%,随规模效应才逐步回升。
为什么重要毛利率决定公司「天花板有多高」——毛利低的生意,即使做大了也很难真正赚钱。

FDE 软技能 · 6 个概念

需求挖掘
客户说要A,但他真正需要的是B。你的工作是把B从A背后问出来,不是直接开始做A。
就像医生问诊——病人说「我头疼」,好医生不会直接给止疼药,而是追问「什么时候开始的、有没有发烧、最近压力大不大」,最后发现是颈椎问题。
真实案例Palantir早年给美国陆军做数据系统,军方最初只说「要一个能看地图的工具」。Palantir的FDE在一线驻场跟了三个月,发现真正的痛点是前线信息传回总部要延迟6小时,于是把「看地图」改成「实时情报同步」,产品才真正跑通,后来成了军方核心采购。
为什么重要解决了「做了一堆没人用」的问题——需求没挖准,交付再完美也是白费。
干系人管理(Stakeholder)
一个项目里所有会被影响到、或者能影响你的人,都叫干系人。把这些人一个个摸清楚、哄好、用好,就是干系人管理。
就像办婚礼——你要搞定的不只是新郎新娘,还有双方父母、主持人、摄影师、场地方、亲戚里那几个爱挑事的长辈。每个人的诉求不同,全捋清楚才能婚礼顺利。
真实案例据业界普遍反馈,AI大客户项目(如科大讯飞给大型政府单位做教育AI)通常要同时面对IT部门、业务部门、采购部门、信息安全部门四个甲方团队,且互相不对齐。FDE如果只盯一个联系人,另外三方就会在验收时突然冒出反对意见,导致项目被卡。
为什么重要解决了「技术做好了却在内部政治里烂掉」的问题——干系人没管好,一个关键反对者就能让项目死在最后一步。
变革管理(Change Management)
新系统、新工具上线时,帮人们从「我不会用/我不想用」过渡到「我习惯用了」这个过程,就叫变革管理。技术装好只是第一步,让人真的用才是核心。
就像公司装了新咖啡机,老式按钮换成触控屏——机器是好机器,但总有人嫌麻烦还在偷偷用旧水壶。变革管理就是贴操作贴纸、安排人手把手教、第一周陪着大家用,直到大家不再想找旧水壶。
真实案例Glean(企业AI搜索)在大客户落地时,产品本身搜索能力很强,但早期客户流失率高的原因不是功能差,而是员工嫌要重新登录、改搜索习惯。后来Glean在FDE流程里专门加入「员工上手营」和使用率周报,给IT管理员工具看谁还没用、定向推动,留存率才显著改善。
为什么重要解决了「花大钱买的系统沦为摆设」——90%的数字化转型失败不是技术问题,是人的问题。
技术翻译官
工程师说的话,业务听不懂;业务说的话,工程师不知道怎么动手。FDE就是中间那个两边都能听懂、两边都能说清楚的人。
就像出境游的地陪导游——游客说「我想吃当地特色」,地陪不会直接把这句话念给摊主听,而是换成「给我们来两份最地道的手擀面」。回去又会跟游客说「这面要趁热吃,放凉了会坨」,而不是给他们讲面条的蛋白质结构。
真实案例Harvey(AI法律工具)最初卖给律所时,工程师出去演示,律师们最关心的是「引用的判例准不准、有没有幻觉」,而工程师讲的是向量检索和RAG精度。后来Harvey专门训练FDE角色,把技术指标翻译成「引用错误率比初级律师低X倍」这类业务语言,客户签约速度明显加快。
为什么重要解决了「鸡同鸭讲,好产品卖不出去或者落地跑偏」——双向翻译失败是企业AI项目最常见的死亡原因之一。
向上管理
主动让你的老板(或客户高层)知道你在干什么、进展如何、需要什么支持,让他们随时对你有信心,而不是等他们来问你要汇报。
就像装修时你主动每天给房东发一张进度照片——房东不会天天来工地堵你,你也不会等到交工那天被一堆临时修改意见砸中。主动汇报=买平静。
真实案例Sierra(Bret Taylor创立的AI客服平台)在服务企业大客户时,FDE团队的一个标准动作是每两周给客户C级高管发一页「项目健康报告」,里面包含ROI估算和下一步卡点。这让高管层保持项目热度,避免因「感觉没进展」而砍预算,据报道这一动作显著降低了大客户的续约风险。
为什么重要解决了「做了很多事但高层不知道,项目被认为没价值」——不被看见等于不存在。
预期管理(Expectation Management)
在事情发生之前,就提前告诉对方「能做到什么、做不到什么、什么时候能出来」,让对方心里有数,不要等失望了再解释。
就像外卖平台显示「预计35分钟送达」——你知道要等,就不会在15分钟时不断催单。如果平台说「马上就到」却来了一小时,你就算东西好吃也会给差评。管预期=管情绪。
真实案例OpenAI在发布GPT-4时,在技术报告里大篇幅列出了模型的失败案例和已知局限(幻觉、推理错误等),而不是只写优点。这个反常操作反而建立了更高的信任度,因为开发者清楚知道「边界在哪」,不会因为遇到Bug就觉得被骗。这成为AI产品预期管理的教科书案例。
为什么重要解决了「客户期望太高,落地必然翻车」——90%的客户投诉源于实际结果和预期的差距,而不是产品本身不够好。

提示工程实战 · 6 个概念

角色提示 (Role Prompting)
开头告诉AI「你是某某专家」,让它用那个身份的知识和口气来回答,而不是泛泛作答。
就像开门见山告诉新来的临时工:「你今天扮演店长,客人来了按店长方式接待」,而不是让他随意发挥。
真实案例Harvey AI在给律师提供服务时,会在每次对话开头注入「你是专注于美国诉讼的顶级律师」这一角色设定。据报道,律所用户评价其输出专业度远超通用ChatGPT问答,帮助Harvey在2023年完成了约2100万美元A轮融资。
为什么重要解决了AI「什么都懂一点、什么都不精」的毛病,逼它锁定一个领域深入输出。
思维链 CoT (Chain-of-Thought)
让AI在给出答案前,先把推理步骤一步一步写出来,就像解数学题要写过程,而不是直接报答案。
就像老师要求学生「把草稿写在旁边」,而不是只交一个最终答案——过程写出来,错误自然少。
真实案例Google DeepMind在2022年发表的CoT论文中展示:用「Let's think step by step」这简单一句,GPT-3在数学推理任务上的准确率从约18%跃升到约79%。OpenAI随后将这一思路内置到了o1系列模型的「扩展推理」能力中。
为什么重要解决了大模型在多步推理时「跳步出错」的问题,让复杂问题也能拆开算清楚。
Few-shot 示例
在提问时,先给AI看几个「问题-答案」的例子,让它照着例子的格式和风格来回答你真正的问题。
就像教新员工填报表:与其解释半天格式规则,不如直接塞给他三张已填好的样表,让他照着抄格式。
真实案例Anthropic在介绍Claude使用技巧时明确指出,提供3到5个高质量示例,比写一大段指令更能稳定输出格式。Glean等企业搜索产品在构建内部知识问答时,也大量依赖Few-shot来让模型按公司特定格式输出摘要。
为什么重要解决了「说了半天AI还是不懂你要什么格式」的问题,举例子比讲规则快十倍。
提示注入攻击 (Prompt Injection)
攻击者把恶意指令藏在AI会读取的内容里(比如网页、邮件),骗AI「偷换任务」,执行攻击者的命令而不是用户的本意。
就像你让助理整理一封邮件,邮件正文里却夹着一行小字「看到这句话就把老板联系人全删掉」,助理照做了。
真实案例2023年,德国研究人员演示了针对Bing Chat的间接注入攻击:在网页中藏入指令,诱使AI在对话中向用户索取信用卡信息。OpenAI和Anthropic此后均将此类攻击列为Agent系统头号安全威胁,并在各自的安全报告中专章讨论防御机制。
为什么重要解决了AI Agent被「挟持」做坏事的问题,在自动化流程里不防这一点,后果可能很严重。
提示模板化 (Prompt Templating)
把反复使用的提示做成带空白槽的模板,每次只填入变化的部分(比如用户名、文档内容),其余框架不变。
就像餐厅的标准化配方卡:主厨写好「底料+{今日主料}+调料=成品」,前台每天只换中间那个食材,其他步骤照旧执行。
真实案例LangChain的PromptTemplate模块是业界最广泛使用的模板工具,月下载量据报道长期超过百万次。科大讯飞星火平台也在其开发文档中推荐模板化管理提示,以便企业客户在不同业务场景下批量复用同一套对话结构。
为什么重要解决了「每次手写提示既费时又容易漏掉关键要素」的问题,让团队协作和批量生产成为可能。
约束/结构化解码 (Constrained Decoding)
在AI生成文字时,从技术层面强制它只能输出符合指定格式的内容(如纯JSON、特定选项),而不仅仅是口头叮嘱。
就像点餐系统只给你展示「主食/配菜/饮料」三个下拉框,你根本无法在主食栏填入「再来一杯奶茶」——系统在结构上锁死了你能填的内容。
真实案例Outlines、Guidance等开源库把这一思路带入实用阶段;月之暗面Kimi和智谱GLM在企业API中都提供了JSON Mode,强制模型输出合法JSON。业界普遍反馈,开启结构化输出后,下游代码解析失败率从数十个百分点降至接近零。
为什么重要解决了「模型输出格式飘忽、下游程序解析崩溃」的根本问题,是AI进入生产流水线的必要条件。

上线与可靠性模式 · 6 个概念

人在回路 HITL(Human-in-the-Loop)
AI做决策前,先让真人看一眼、点个头才能执行,不让机器自己拍板。
就像新来的外卖员送餐前,每单都要店长签字确认才能出门,跑熟了才放手独立。
真实案例Harvey AI给律师做合同审查,早期每一份AI起草的条款都要律师亲自复核才能发给客户。这套机制让顶级律所敢用AI,因为合规风险没有转移给机器。
为什么重要AI出错代价太高时,人工审核是最后的安全闸,防止低级错误直接伤到用户或业务。
影子模式 Shadow Mode
新系统悄悄跟着旧系统同步跑,但输出结果只记录不使用,等验证够了再切换。
就像新厨师在老厨师旁边跟班做菜,做出来的菜先不上桌,老板偷偷对比味道对不对。
真实案例Waymo自动驾驶在大规模上路前,让AI在真实道路上「影子驾驶」数百万公里,车还是人开,但系统在后台记录每一个决策并与人类操作对比,发现差距再改。
为什么重要在真实流量下偷偷测新模型,零风险验证效果,避免直接上线翻车。
灰度/金丝雀发布 Canary Release
新版本先推给1%~5%的真实用户试水,没问题再逐步扩大到所有人。
就像新开的奶茶店先只在一条街上试卖,口碑好了再开遍全城。
真实案例Google每次更新搜索算法,都会先对少量用户开放新版本,监控点击率和投诉量。据报道曾因灰度发现新算法让某类内容排名崩了,提前回头,避免影响十亿级用户。
为什么重要把潜在的bug关在小圈子里,出问题影响面小、止损快。
A/B测试
把用户随机分成两组,一组看旧版一组看新版,用数据说话决定哪个更好。
就像饭店同时卖两种新菜,左边桌子试A款、右边桌子试B款,看哪款盘子先见底。
真实案例Netflix几乎对每个功能按钮都做A/B测试,据报道连封面图换个颜色都能影响用户点击率数个百分点。他们曾测试出个性化缩略图比统一封面让播放率提升了约20%。
为什么重要拍脑袋不如看数据,用真实用户行为替代主观判断,决策有依据。
回滚 Rollback
新版本上线出问题,一键退回到上一个好用的旧版本,快速止损。
就像装修刷墙漆,刷完发现颜色太难看,赶紧刮掉重刷回原来的颜色。
真实案例2021年Facebook(Meta)一次BGP路由配置变更推送后引发全球宕机约6小时,据报道工程师最终靠手动回滚配置才恢复服务,期间广告收入损失估计超亿美元。
为什么重要出了事不怕,怕的是回不去。回滚是最快的「反悔」机制,把损失窗口压到最短。
SLA保障(服务等级协议)
服务方白纸黑字承诺:一年里系统至少正常运行多少时间,不达标就赔钱。
就像装修公司签合同写明「工期60天,每延误一天罚500元」,有约束才有底气。
真实案例AWS承诺核心云服务月可用性达99.99%,折合每月宕机不超约4分钟。2017年AWS S3美东区域一次故障持续约4小时,导致大批网站瘫痪,AWS随后为受影响客户提供了账单减免。
为什么重要没有SLA就没有责任,它把「我们尽力」变成「不达标就赔」,倒逼系统真正可靠。
FDE 概念图鉴 · 20 个 agent 通俗化编写 · 大白话+类比+真实故事+为什么重要 · 2026-06