最近被问得最多的一个问题:”我们公司能不能自己部署一个 AI?数据不想传到外面去。”
答案是能,而且比两年前容易多了。但在掏钱买设备之前,有四件事想清楚能省下不少冤枉钱——尤其是第三件。
我们自己部署了一套跑在公司内网的大模型,用来做技术支持和日常问答。踩完一圈坑之后,最大的收获反而不是”该买什么硬件”,而是:大部分让人觉得”本地 AI 跑起来又慢又笨”的问题,根本不是硬件不行,是配置没弄对。而这个认知差,直接决定你会不会白花几万块。
第一件:先确认你到底该不该自建
自建不是默认选项。大多数企业其实用在线 API 更划算,自建只在下面几种情况才成立:
- 数据确实不能出内网。涉及客户资料、合同、图纸、代码、财务数据,或者行业本身有合规要求。这是自建最硬的理由,也基本是唯一一个”不用算账”的理由。
- 长期、高频、多人用。偶尔用几次,API 便宜到可以忽略;但如果几十个人天天用、还要接进业务系统跑批量任务,账就要重新算。
- 需要长期稳定和可控。在线服务会调整模型、改价格、下线版本;自建的模型放在那儿就不会变,对需要长期一致性的场景有价值。
反过来说:如果只是想让员工写写文案、做做翻译,数据也不敏感——直接买在线服务,几百块一个月的事,别折腾。
第二件:硬件不是”买张好显卡”那么简单
这是最普遍的误解。很多人以为挑最贵的显卡就行,实际上决定你能不能跑、跑多快的,是另外两个指标:
- 显存/内存容量 —— 决定”装不装得下”。模型文件有多大,就得有相应的空间放。装不下就跑不起来,再强的算力也没用。这是一道硬门槛,不是”慢一点”的问题。
- 内存带宽 —— 决定”吐字快不快”。模型生成每个字都要把相关数据搬运一遍,带宽不够,再多算力也在空等。本地部署的速度瓶颈,通常卡在带宽而不是算力。
选模型有个反直觉的铁律:别只看参数总量。
现在很多模型采用的结构,是”总参数很大,但每次实际只调用其中一小部分”。决定速度的是”每次实际调用的那部分”有多大,而不是总量。所以一个总量大但每次只用一小部分的模型,可能比一个总量小但全部都要算的模型快好几倍。选型时一定要问清楚这两个数字,只看总量会做出完全错误的判断。
第三件:”慢”的真凶,大概率不是硬件
这一条是我们花了最多时间才想明白的,也最值钱。
部署完之后同事反馈”太慢了,不好用”。第一反应是设备不行、该加钱升级。但逐个排查下来,三次”慢”没有一次是硬件的问题:
- 真凶一:它把力气全花在”想”上,最后没输出。新一代模型大多有”深度思考”能力,默认可能是开着的。结果是它在内部推理上消耗了大量时间和算力,而你等了很久,拿到的正文却是空的。看起来像”卡死了”,实际是参数没配对。
- 真凶二:它其实答了,但答案被放错了地方。这个更隐蔽——模型正常输出了,但因为某个解析设置,正文全被归进了”思考过程”字段,而正文字段是空的。表现出来和第一种一模一样,极容易误判成”模型不行”。
- 真凶三:慢的是”第一个字”,不是整体速度。用户体感的快慢,主要来自从提问到蹦出第一个字的等待时间,而不是后面的输出速度。我们开启了一项针对重复内容的缓存优化后,这个等待时间从十几秒降到不到两秒——硬件一点没动。
所以遇到”本地 AI 很慢”,正确的顺序是:先确认是不是配置问题,再考虑加硬件。顺序反了,可能几万块花下去,问题还在。
还有个容易掉进去的坑:有些”优化参数”在特定硬件上是帮倒忙的。我们按通用建议调大过一个参数,结果反而比默认值慢了将近一半。任何调优都要在自己的设备上实测对比,别照搬网上的建议。
第四件:把账认真算一遍
自建的成本不只是买设备那笔钱:
| 成本项 | 自建 | 在线 API |
|---|---|---|
| 初期投入 | 一次性设备支出,数万元起 | 几乎为零 |
| 使用成本 | 只有电费,用多用少差别不大 | 按用量付费,用得越多越贵 |
| 运维人力 | 最容易被低估的一项:部署、调优、升级、故障处理都要人 | 基本不用管 |
| 数据安全 | 数据不出内网 | 取决于服务商条款,敏感数据需谨慎 |
| 能力更新 | 要自己跟进换新模型 | 自动用上新版本 |
最容易被漏算的是运维人力。设备买来只是开始:装环境、调参数、模型更新、出问题排查,都需要懂行的人。如果公司没有这样的人,要么外包,要么这套设备会慢慢变成机房角落里一台没人敢动的机器。
建议路径:别一上来就买设备
用在线服务先跑一两个月,把”到底哪些场景真的有人用、用得有多频繁、涉不涉及敏感数据”这几件事摸清楚。这个阶段花的钱很少,但能挡掉大部分冲动决策。
等到确认了”确实高频 + 数据确实不能外传”,再按验证过的真实需求去选设备——这时候你知道自己要跑多大的模型、多少人同时用,选型会准得多,也不会为用不上的性能付钱。
几个常见疑问
Q:本地部署的效果,和在线的大模型差多少?
A:差距比很多人想的小,尤其在问答、总结、文档处理、写代码这类日常场景。但最顶尖的推理能力仍然在最大的那些在线模型手里。务实的做法是分开用:敏感数据和高频任务走本地,偶尔的高难度任务走在线。
Q:需要专门找个人来管吗?
A:日常运行不需要天天有人盯,但部署、调优、升级这几个节点需要懂行的人。中小企业常见的做法是让 IT 服务商一起管,和服务器、网络放在同一份运维里,比单独养人现实。
Q:数据放在自己机器上,就一定安全吗?
A:不一定。本地部署解决的是”数据不出公司”,但公司内部的访问权限、日志留存、谁能查什么,仍然要单独设计。见过把内部 AI 直接开放给全员、结果敏感文档被随意检索的情况。
Q:现在入手会不会太早,过两年设备就淘汰了?
A:这个顾虑合理。所以更建议从真实且持续的需求出发,而不是为了”上 AI”而上。有明确高频场景的,现在投入就能持续产生价值;还没想清楚用来干嘛的,等等确实更好。
在考虑把 AI 部署到公司内网,但不确定值不值、怎么选?
思文力得为北京及周边中小企业做 IT 运维外包与网络整包服务,也帮客户做内网 AI 的选型、部署与后续运维:先帮你判断该不该自建、按真实场景选配置,部署后把调优和日常维护一并纳入运维托管,避免设备买回来没人会管。文中那些坑,是我们在自己这套环境上一个个踩出来的。访问 siwenlide.com(或先看看我们的公司简介)或拨 400-686-2011 聊聊。





