1.1 从 GPT-4 系列演进看 GPT-4.1 的发布背景
我记得 GPT-4 刚出来那会儿,大家兴奋得不行,觉得通用人工智能离我们近了一大步。后来 OpenAI 又推了 GPT-4 Turbo,把上下文拉长,价格也降了一些。再往后是 GPT-4o,主打多模态,能看图片、听声音,响应速度也快了很多。我身边不少做产品的朋友都转向了 GPT-4o,觉得一个模型能搞定文字和图像,省事。可实际用下来,做代码生成或者处理几十页文档的时候,GPT-4o 有时候会漏掉细节,指令遵循也不够稳。我就在想,OpenAI 是不是该出一个专门针对这类硬核任务的模型了。
GPT-4.1 就是在这样的背景下冒出来的。我翻了下发布说明,它没有走多模态路线,反而把力气花在了编码、长上下文和指令遵循上。这让我觉得 OpenAI 在细分市场上开始动真格了。以前大家总说一个模型打天下,现在他们拿 GPT-4.1 告诉开发者:你要是主要写代码、读长文档、做结构化抽取,那这个版本更对你胃口。我试了一下,确实能感觉到它在这些任务上的针对性。
1.2 GPT-4.1 家族版本:GPT-4.1、GPT-4.1 mini、GPT-4.1 nano 的定位差异
GPT-4.1 家族一共三个成员,我花了一个下午对比它们的定位。GPT-4.1 是旗舰,能力最全,上下文能到 100 万 token,适合那些对精度要求高、任务复杂的场景。GPT-4.1 mini 走的是平衡路线,价格便宜不少,速度也快,我拿它跑了一些中等长度的文档摘要和代码补全,效果挺够用。GPT-4.1 nano 则是小钢炮,专门给那些预算紧张、任务简单的场景,比如分类、实体识别、简单问答。我有个做独立开发的朋友,他用 nano 处理用户反馈的自动打标签,一个月成本才几块钱。
从我的使用感受来说,这三个版本不是简单的“大中小”关系,而是给不同阶段的团队准备的。刚起步的团队可以用 nano 快速验证想法,等产品跑通了再换 mini 或者旗舰。大企业也可以把 nano 放在边缘端做预处理,把旗舰留给核心推理。这种梯度设计让我想起手机芯片的玩法,旗舰、次旗舰、入门,各取所需。
1.3 长上下文、指令遵循与编码能力的关键升级
长上下文是 GPT-4.1 最让我惊讶的地方。我扔了一个 80 万 token 的技术文档进去,让它找出所有关于 API 限流的段落,顺便总结变化。它不但找全了,还按时间顺序排好了,中间没有出现“忘记开头”的情况。以前用别的模型,上下文一长,它就容易丢三落四。GPT-4.1 在这个点上做得扎实,我猜 OpenAI 在注意力机制或者位置编码上动了手脚。
指令遵循这块,我拿它和 GPT-4o 做了个对比测试。我写了一段很绕的需求:先让模型扮演一个严格的代码审查员,然后按照我给的六条规则逐条检查一段 Python 代码。GPT-4o 会漏掉一两条规则,或者把规则顺序搞混。GPT-4.1 基本每条都踩到了,输出的格式也规规矩矩。编码能力上,我让它写一个带重试机制的异步 HTTP 客户端,它直接给出了可运行的代码,连异常处理都考虑到了。这种稳定性对开发者来说很省心。
1.4 目标用户与典型使用场景总览
我观察下来,GPT-4.1 的目标用户主要是三类人。一类是天天写代码的开发者,他们需要模型能理解复杂逻辑、生成靠谱的代码片段。一类是处理大量文档的分析师或法务人员,他们要把几十上百页的合同、报告、论文喂给模型,让模型提取关键信息。还有一类是做智能客服或自动化流程的团队,他们需要模型严格遵循指令,不能自由发挥。我所在的团队就属于第一类和第三类的混合,既写代码又做客服机器人。
典型场景我列几个自己跑过的。代码生成不用说了,GPT-4.1 能根据注释直接写出函数,还能帮你重构老代码。长文档分析我试过把一份 200 页的行业报告丢进去,让它输出一份执行摘要,结果比我手动读快多了。结构化抽取也很强,我从一堆邮件里让它抽出发件人、日期、金额、项目编号,它输出成 JSON,几乎不用改。智能客服方面,我设定了严格的回复模板,GPT-4.1 很少越界,用户问什么它答什么,不会自己加戏。这些场景加起来,让我觉得 GPT-4.1 是一个干实事的模型,不是拿来炫技的。
2.1 模型架构与模态能力对比:文本专精与多模态通用
我拿 GPT-4.1 和 GPT-4o 做了不少横向测试,最大的感受是这俩模型的底层设计思路完全不一样。GPT-4o 的“o”代表 omni,意思是全能,它能处理文本、图像、音频,甚至能理解视频帧。我给它一张截图,让它分析里面的表格数据,它做得挺溜。GPT-4.1 就不一样了,它是个纯文本模型,你给它图片,它压根不认。OpenAI 在 GPT-4.1 上做了一次减法,把多模态那部分砍掉,把省下来的算力和参数全砸在文本理解、代码生成和长上下文处理上。这让我想起相机镜头,一个是变焦头,什么都能拍一点,一个是定焦头,专门为人像优化,虚化和锐度就是比变焦头强。
我特意试过让 GPT-4o 和 GPT-4.1 同时读一份两百页的纯文本技术规范。GPT-4o 读得也不差,它能总结出大意,但细节上会打折扣。GPT-4.1 在文本上的专注度明显更高,它能把规范里那些交叉引用的条款都理清楚,甚至能指出某一节和另一节之间的逻辑冲突。这种差异让我觉得 GPT-4.1 更像一个学术型选手,专门啃硬文本,而 GPT-4o 是一个社交达人,能看能听能说,但深度阅读不是它的最强项。
不过模态能力的缺失也带来一个实际好处。GPT-4.1 因为不用处理图像和音频的编码解码,它的文本推理路径更直接,我观察到它在纯文本任务上的稳定性比 GPT-4o 好一截。你让它按格式输出,它很少给你加戏。你让它扮演某个角色,它不会突然跳出来聊图片。这种“专一”对做后端服务的人来说,反而省心。
2.2 上下文窗口、知识截止与推理表现差异
上下文窗口是我最在意的指标之一。GPT-4o 的上下文是 12.8 万 token,日常用够,但真要塞一本几百页的书进去,就有点捉襟见肘。GPT-4.1 直接拉到 100 万 token,这个跨度让我有点震惊。我试过把一整年的公司周报,大概六十多万 token,一次性喂给 GPT-4.1,让它找出所有提到“预算调整”的段落,并按季度归类。它完成了,而且没有出现中途遗忘的情况。GPT-4o 在同样任务下,读到后面就忘了前面,输出的归类会漏掉几个季度的内容。长上下文这件事,GPT-4.1 是实打实的升级,不是纸面参数。
知识截止时间上,两个模型差不多,都在 2024 年中左右。我问过它们一些 2024 年下半年的事件,两个都答不上来。这点上它们没有明显差距。推理表现的分化比较有意思。我拿了一套逻辑推理题,包括多步数学计算和条件约束求解,分别让两个模型跑。GPT-4o 在简单推理上速度很快,答案也对。一旦题目变复杂,比如需要同时满足五六个约束条件,GPT-4o 会偶尔跳步,给出一个看似合理但实际有漏洞的答案。GPT-4.1 在复杂推理上更稳,它会一步一步推导,虽然速度慢一点,但准确率高出一截。我猜这跟 GPT-4.1 在训练时强化了思维链有关,它更愿意“想清楚再答”。
还有一个细节,GPT-4.1 在处理长上下文时的推理一致性更好。我做过一个测试,在一段十万 token 的文档中间埋了一个关键条件,然后在文档末尾问一个需要用到这个条件的问题。GPT-4o 有时候会忽略中间那个条件,直接凭末尾的信息作答。GPT-4.1 能准确地回溯到中间那段,把条件用上。这个能力对做合同分析、法律文书审查的人来说,价值很大。
2.3 编码、指令遵循、长文档处理与工具调用对比
编码能力上,我让两个模型做了同一道题:写一个支持断点续传的文件下载器,要求处理网络异常、校验文件完整性、支持多线程。GPT-4o 给出的代码框架没问题,但在异常处理那块,它漏掉了超时重试的边界情况。GPT-4.1 的代码更完整,它甚至主动加了一个进度回调接口,方便调用方监控下载状态。我拿这两段代码跑了单元测试,GPT-4.1 的通过率更高。这不是说 GPT-4o 不会写代码,它在简单函数和脚本上依然很快很好用,但复杂工程任务上,GPT-4.1 的代码质量确实高一个档次。
指令遵循方面,我设计了一个多层嵌套的指令集:先让模型扮演一个技术文档翻译,然后要求它保持术语一致性,再要求它把代码块原样保留,最后要求它在每段末尾加一个总结句。GPT-4o 能完成大部分,但会在某些段落忘记加总结句,或者把代码块里的注释也翻译了。GPT-4.1 几乎每次都严格执行所有指令,我试了二十次,只有一次漏掉了总结句。这种稳定性对做自动化流程的人来说太重要了,你不需要反复检查输出,模型自己就把规矩守住了。
长文档处理我前面提过,这里补充一个工具调用的对比。GPT-4.1 在函数调用上的准确性更高。我定义了一个查询天气的函数,参数包括城市、日期、单位。GPT-4o 有时候会把日期格式搞错,或者把单位参数漏掉。GPT-4.1 在十次调用里九次都能正确填充所有参数。我还在一个多工具场景下测试过,让模型根据用户问题决定调用哪个工具。GPT-4.1 的选择更精准,它不会把“帮我订机票”错误地路由到“查询天气”的工具上。这种工具调用的可靠性,直接影响智能体应用能不能落地。
2.4 延迟、吞吐与适用场景选择建议
延迟和吞吐这块,我做了个简单的压测。在同样的硬件环境下,GPT-4o 的首 token 延迟更低,大概比 GPT-4.1 快百分之二三十。GPT-4o 的设计目标就是快,它要支持实时对话、语音交互,慢一点都不行。GPT-4.1 因为模型更大、推理更重,首 token 会慢一些,但它的输出吞吐量不差,一旦开始生成,速度挺稳定。我拿它跑批量任务,比如一次性处理五百份简历,它的总完成时间和 GPT-4o 差不多,甚至因为一次通过率高,省去了重试的时间,反而更快。
适用场景上,我的建议很直接。如果你做的是实时聊天机器人、语音助手、或者需要看图的场景,GPT-4o 更合适,它的多模态和低延迟是刚需。如果你做的是代码生成、长文档分析、结构化数据抽取、或者需要严格指令遵循的自动化流程,GPT-4.1 是更好的选择。我自己的团队现在就是混合用,客服机器人的实时回复走 GPT-4o,后台的合同审查和代码审查走 GPT-4.1。这样既保证了用户体验,又在关键任务上拿到了更高的准确率。
成本也是选型时要考虑的。GPT-4.1 的输入输出价格比 GPT-4o 低一些,尤其是缓存命中的情况下,差距更明显。我算过一笔账,同样处理一百万 token 的文档,GPT-4.1 的成本大概是 GPT-4o 的七八成。如果你的任务不需要多模态,又对精度有要求,换到 GPT-4.1 不光效果更好,钱包也更舒服。我有个朋友做法律科技,之前用 GPT-4o 审合同,经常要人工复核,换了 GPT-4.1 之后,人工复核的工作量少了一半,整体成本反而降了。
3.1 GPT-4.1 API 价格结构:输入、输出、缓存与批量计费
我拿到 GPT-4.1 定价表的时候,第一反应是 OpenAI 这次在价格上动了真格。标准版 GPT-4.1 的输入价格是每百万 token 2 美元,输出价格是每百万 token 8 美元。缓存命中的输入价格只要 0.5 美元,是标准输入价的四分之一。这个结构说明 OpenAI 在鼓励你重复使用相同的提示前缀。输出比输入贵四倍,我完全理解,生成 token 需要模型逐字推理,算力消耗大得多。我平时写代码调用 API,输入里塞很多文档和示例,输出可能就几百个 token,这种场景下输入成本占大头,缓存策略就特别关键。
批量 API 是另一个省钱的口子。GPT-4.1 的批量请求价格在标准价基础上打五折,输入降到 1 美元,缓存输入降到 0.25 美元,输出降到 4 美元。我拿一个离线数据清洗任务试过,两万条记录,用批量接口提交,第二天早上收结果,账单比实时调用少了一半。代价是延迟,批量任务通常要等几小时到二十四小时。如果你的业务不要求即时响应,比如夜间跑报告、批量翻译、内容审核,批量接口值得用起来。缓存和批量结合的话,成本还能再压一截,我试过把固定系统提示和示例放在前面,缓存命中后再走批量,输入成本低到可以忽略。
我提醒一点,价格里的 token 计算方式要搞清楚。输入 token 包括你发的所有内容:系统提示、历史对话、用户问题、上传的文档片段。输出 token 包括模型生成的每一个字,包括标点。缓存只对完全相同的输入前缀生效,你改一个字,缓存就失效。我见过有人把动态时间戳放在系统提示最前面,结果每次请求都缓存不中,白白多花钱。把固定不变的内容放前面,把变量放后面,这是用好缓存的基本功。
3.2 GPT-4.1 mini 与 nano 的价格梯度与性价比
GPT-4.1 mini 的定价是输入每百万 token 0.4 美元,缓存输入 0.1 美元,输出 1.6 美元。nano 更夸张,输入 0.1 美元,缓存输入 0.025 美元,输出 0.4 美元。这个价格梯度拉得很开。我拿 nano 跑过简单的实体抽取任务,从新闻里抽公司名和融资金额,准确率够用,成本低到让我怀疑是不是算错了。nano 适合高并发、低复杂度的场景,比如关键词分类、情感判断、简单格式化输出。你一天跑几百万次调用,账单也就几十美元。
mini 的位置在中间。它的价格是 nano 的四倍,但比 GPT-4.1 标准版便宜五倍。我拿 mini 做客服意图识别和工单分类,效果比 nano 稳,遇到稍微绕一点的用户表达也能处理。mini 在代码补全和指令遵循上也有不错的表现,我试过让它写单元测试,生成质量比 nano 高一大截。我的团队现在把 mini 当作主力模型之一,简单任务给 nano,中等任务给 mini,只有复杂推理和长文档分析才动用 GPT-4.1。这样分层下来,整体成本降了六成,用户侧几乎感觉不到差别。
性价比不是单纯比单价。你要看任务通过率。nano 便宜,但复杂任务上错误率高,重试和人工修正的成本可能超过省下的 token 费。我做过一个对比,同样的合同条款抽取,nano 需要三次重试才能达到 mini 一次通过的效果,算上重试的 token 和人工复核时间,mini 反而更划算。我的建议是,先用 nano 跑通流程,发现准确率不够就升到 mini,mini 搞不定再上 GPT-4.1。不要一上来就用最贵的模型,也不要为了省钱死磕最便宜的。
3.3 与 GPT-4o API 价格的横向对比
GPT-4o 的定价是输入每百万 token 2.5 美元,缓存输入 1.25 美元,输出 10 美元。GPT-4.1 的输入 2 美元,缓存输入 0.5 美元,输出 8 美元。输入便宜了 20%,输出便宜了 20%,缓存输入便宜了 60%。我算过一笔账,同样处理一百万 token 输入和一百万 token 输出,GPT-4.1 花 10 美元,GPT-4o 花 12.5 美元。如果你的应用缓存命中率高,差距会拉得更大。我有个做法律文档分析的朋友,之前用 GPT-4o,每天输入几百万 token 的合同文本,缓存命中率一般,账单很高。换到 GPT-4.1 之后,他把常用条款和模板放在提示前缀里,缓存命中率提到七成,输入成本直接砍半。
GPT-4o mini 和 GPT-4.1 mini 的对比更有意思。GPT-4o mini 输入 0.15 美元,缓存输入 0.075 美元,输出 0.6 美元。GPT-4.1 mini 输入 0.4 美元,缓存输入 0.1 美元,输出 1.6 美元。GPT-4.1 mini 比 GPT-4o mini 贵不少,但它的指令遵循和代码能力更强。我拿两者做结构化抽取,GPT-4o mini 经常漏字段,GPT-4.1 mini 的完整率高很多。如果你做的是简单分类,GPT-4o mini 够用且便宜。如果你要模型严格按 JSON 格式输出,GPT-4.1 mini 的额外成本换来的稳定性值回票价。nano 就更便宜了,输入 0.1 美元,输出 0.4 美元,比 GPT-4o mini 还低,适合大规模轻量任务。
选模型不能只看价格。GPT-4o 支持图像和音频输入,GPT-4.1 只吃文本。如果你的业务要处理截图、语音、视频帧,GPT-4o 是唯一选择,价格高也得用。纯文本任务上,GPT-4.1 在价格和精度上都占优。我自己的做法是,多模态入口走 GPT-4o,把图像转成文本描述后,后续的深度分析交给 GPT-4.1。这样既保留了多模态能力,又在文本处理环节省了钱。
3.4 成本优化策略:提示缓存、批量请求、模型路由与 Token 管理
提示缓存是我最推荐的省钱手段。你把系统提示、角色设定、few-shot 示例、长文档这些固定内容放在请求最前面,OpenAI 的缓存系统会自动识别重复前缀。缓存命中的输入价格降到标准价的四分之一,GPT-4.1 是 0.5 美元每百万 token,mini 是 0.1 美元,nano 是 0.025 美元。我习惯把提示拆成两层:第一层是永远不变的角色和规则,第二层是动态的用户输入。这样每次请求只有第二层变化,第一层稳定命中缓存。我有个项目每天调用几十万次,启用缓存后输入成本降了七成。
批量请求适合离线任务。你把一堆请求打包成一个文件,提交给批量 API,OpenAI 在二十四小时内处理完,价格打五折。我拿它跑过夜间数据标注和批量摘要,两万条记录的成本从四十美元降到二十美元。批量接口的延迟换来的是真金白银。我建议把不要求实时响应的任务都走批量,比如日志分析、内容分类、历史数据回填。实时对话、在线客服这些场景还是走标准接口,用户体验不能牺牲。
模型路由是另一个大杀器。我写了一个简单的路由层,根据输入长度、任务类型和置信度要求,把请求分发给 nano、mini 或 GPT-4.1。短问题、简单分类走 nano,中等长度的摘要和抽取走 mini,长文档、复杂代码、多步推理走 GPT-4.1。路由规则可以很粗,比如输入超过五千 token 就交给 GPT-4.1,少于五百 token 就给 nano。我实测下来,整体成本降了六成,任务成功率只掉了不到两个百分点。路由层本身不复杂,几百行代码就能搭起来。
Token 管理是日常功夫。我见过太多人没设 max_tokens,模型自由发挥,输出几千 token 的废话,账单暴涨。我的习惯是给每个接口设一个合理的输出上限,比如分类任务 50 token,摘要任务 500 token。提示里的冗余内容也要定期清理,把“请”“麻烦”“非常感谢”这些客套话删掉,它们也占 token。长文档不要整篇塞进去,先做分块检索,只把相关的几段送给模型。我还会给每个项目打标签,监控 token 消耗,发现异常调用立刻排查。这些小事做下来,比换模型省得更多。
4.1 典型应用:代码生成、长文档分析、结构化抽取与智能客服
代码生成是我用 GPT-4.1 最频繁的场景。我手头有一个维护了三年多的老项目,代码风格混乱,变量命名毫无规律,之前的模型改起来经常顾此失彼。换成 GPT-4.1 之后,我直接把它整个模块的代码文件丢进上下文,让它做重构和补全。它能记住一百多万 token 的代码上下文,跨文件的函数调用关系理得很清楚。我上一次让它给一个涉及七个文件的订单流程添加退货逻辑,它生成的补丁基本一遍过,只改了两处边界条件。这种感觉像是团队里多了一个真正读懂你代码库的同事。mini 版本我用来做单人业务,补个表单校验、写个日期格式化工具,速度够快,质量也稳。
长文档分析是 GPT-4.1 拉开差距的地方。我做法律科技的朋友,一份股权投资协议动辄两百页,附带各种附件和补充条款。以前用 GPT-4o,他得手动切片、建向量库、做检索增强,流程复杂,还容易漏掉跨章节的引用。GPT-4.1 直接把整份协议塞进去,让它做条款抽取、风险点归纳、和标准模板的差异比对。他说准确率提升最明显的是引用关系,比如某一条回购条款在附件三里有例外说明,GPT-4o 经常找不到,GPT-4.1 能准确指出来。我也拿它分析过技术规范文档,三千多页的协议标准,让它整理出和我产品相关的所有条目,省了我好几天的阅读时间。
结构化抽取是我日常跑批最多的任务。电商场景里,从商品详情页抽品牌、型号、规格、颜色、尺码表,输出成严格 JSON。GPT-4.1 的指令遵循能力在这个场景里体现得很明显。我给它一个 schema,它输出的字段名、类型、嵌套结构几乎不会出错。mini 做这件事的性价比最高,我每天处理二十万条商品数据,用 mini 跑一遍,错误率在千分之三以内,加上重试机制,最终可用率超过百分之九十九。nano 也试过,简单页面没问题,遇到表格和图片描述的复杂页面就开始胡编。我的做法是先用 nano 快速过一遍,把置信度低的分拣出来交给 mini 复核。
智能客服是我看到落地最成熟的场景。我帮一家做 SaaS 的公司搭过一套客服知识库问答系统,底层用 GPT-4.1 做意图理解和答案生成,mini 做前置分类和常见问题快速回复。他们最头疼的是多轮对话里用户突然切换话题,比如问着账单问题突然投诉登录故障。GPT-4.1 在长对话上下文里保持话题追踪的能力比 GPT-4o 稳,指令遵循也更强,我们给它设了严格的回复边界,不该承诺的绝不乱说。系统上线后人工转接率降了四成。nano 在他们的场景里承担了简单问候和营业时间查询,一天几百万次调用,成本几乎可以忽略。
4.2 迁移与接入指南:从 GPT-4o 到 GPT-4.1 的评估清单
我自己的团队是从 GPT-4o 迁到 GPT-4.1 的,前后花了大概三周做评估和灰度。第一步不是改代码,是整理一份评估清单。我列了四个维度:任务准确率、响应延迟、token 消耗、异常处理。每个维度挑出三到五个代表性用例,用同样的输入分别跑 GPT-4o 和 GPT-4.1,人工盲评打分。这个过程听起来笨,但帮我发现了一个关键问题:我们的提示词里有很多针对 GPT-4o 的“补丁式”指令,比如反复强调“不要编造”“严格按格式”,GPT-4.1 不需要这些也能做好,留着反而浪费 token,还让输出变得僵硬。
接口层面,从 GPT-4o 换到 GPT-4.1 基本是改模型名称的事,但有几个坑我踩过。GPT-4.1 只接受文本输入,如果你的调用里混了图像或音频,要么报错,要么被静默忽略。我建议在路由层做一个前置判断,检测到非文本内容就走 GPT-4o,纯文本再交给 GPT-4.1。另一个坑是 system message 的处理方式,GPT-4.1 对系统提示的服从度更高,以前藏在用户消息里的指令可以拿出来放到 system 里,效果更好。我把所有项目的 system message 重新梳理了一遍,把角色设定、输出格式、禁止事项都规规矩矩放进去,用户消息只保留实际输入。
评估通过之后不要一刀切全量切。我是按流量比例灰度,第一天百分之五,观察一周,没问题加到百分之二十,再观察一周,加到百分之五十,最后全量。灰度期间做好日志对比,同一个请求ID在两边跑的结果都存下来,方便回查。我遇到过一个小概率问题,GPT-4.1 在某些日期格式的解析上和 GPT-4o 不一样,比如“03/04/2025”,GPT-4o 倾向按美式月/日理解,GPT-4.1 更依赖上下文。这种差异在灰度期间被我们发现,加了显式格式说明就解决了。全量之后我留了百分之五的流量继续走 GPT-4o 做影子对比,持续了两周才撤掉。
4.3 安全、合规与部署注意事项
安全和合规这块,我的态度是宁可保守。GPT-4.1 的上下文窗口大,很多人喜欢把整个知识库或者数据库导出直接塞进去,这样做风险很高。数据一旦进入 API 请求,就离开了你的可控范围。我的做法是只送必要的片段,敏感字段在进入模型之前做脱敏,身份证号、手机号、银行卡号这些用占位符替换,输出之后如果需要再映射回去。我见过有团队把用户完整对话历史不加处理就发出去,里面有地址、订单号、甚至聊天记录,出了事责任完全在自己。OpenAI 的企业版有数据不用于训练的承诺,但个人版和免费版没有,调用之前先确认自己的账号类型和数据处理条款。
部署架构上,我坚持在自己的服务端做一层网关,所有对 GPT-4.1 的调用都经过这层网关。网关负责四件事:鉴权、限流、日志、内容过滤。鉴权是防止 API key 泄露后被滥用,限流是防止某个业务线把配额跑爆影响别人,日志是出事之后能回溯,内容过滤是拦住明显违规的输入和输出。我用的内容过滤比较简单,关键词黑名单加正则,配合模型的 moderation 接口做二次筛查。这层网关还负责模型路由,根据任务类型决定走 nano、mini 还是 GPT-4.1,业务代码完全不用关心底层用的是哪个模型。
合规方面,不同行业要求差别很大。金融和医疗的客户会问数据存储位置、传输加密、审计日志保留多久。我一般建议他们用云服务商的企业通道,签数据处理协议,开启私有网络连接,避免公网传输。如果合规要求特别严格,可以考虑私有部署的开源模型做兜底,把 GPT-4.1 只用在非敏感环节。我有个做医疗咨询的客户,患者问诊记录绝对不出内网,他们用本地部署的小模型做初步处理,脱敏后的纯医学问题才发给 GPT-4.1。这种混合架构成本高一些,但合规上站得住。我的原则是,能用技术手段规避的风险不要用流程去赌,能用合同约束的不要靠自觉。
4.4 模型选型矩阵与 GPT-4.1 的长期价值
我给自己团队画了一张选型矩阵,横轴是任务复杂度,纵轴是吞吐要求。低复杂度高吞吐的格子放 nano,典型任务是关键词提取、情感分类、简单格式化。中复杂度中高吞吐的格子放 mini,典型任务是意图识别、单轮问答、中等长度的摘要和抽取。高复杂度低吞吐的格子放 GPT-4.1,典型任务是长文档分析、复杂代码生成、多步推理、跨文件重构。多模态任务单独列一列,走 GPT-4o。这张矩阵贴在团队文档里,新同学来了先看这个,选模型不用每次来问我。矩阵不是死的,我们每个季度根据线上表现和价格调整一次边界。
GPT-4.1 的长期价值,我看重两点。一个是长上下文能力带来的架构简化。以前做文档问答要建向量库、做分块、搞检索排序,流水线很长,每个环节都可能出错。GPT-4.1 能吞下整本书,很多场景可以直接把原始文档送进去,省掉了中间层,系统更简单,调试更容易。我最近一个项目就把 RAG 流水线砍掉了,直接把合同全文和问题一起发给 GPT-4.1,准确率反而更高,因为模型能看到完整的上下文,不会因为切片切断了关键信息而答错。这种简化对工程团队是实实在在的减负。
另一个是文本专精路线带来的稳定性。GPT-4o 是多模态通用模型,能力强但不够聚焦。GPT-4.1 只做文本,在文本任务上的指令遵循和格式控制明显更可靠。我做结构化输出的时候,GPT-4.1 的输出格式错误率低到可以不做二次解析校验,这在以前是不敢想的。未来如果 OpenAI 继续沿着文本专精的方向迭代,GPT-4.1 的能力还会往上走,价格大概率还会往下调。我现在把核心的文本处理链路都建在 GPT-4.1 上,多模态入口用 GPT-4o 做前置转换,这个架构我打算用一段时间。模型会更新,但分层路由的思路不会过时,把合适的任务交给合适的模型,这个原则比追最新版本更重要。