2026年8月18日 · 阅读时长 8 分钟 · Sam Akbari
判断人工智能是否真正内建于平台的七个问题
如今每家厂商都说自己的平台是人工智能原生的。七个问题可以区分哪些是架构事实,哪些只是产品清单上的一行,而且每个问题都有你可以在演示中当场索要的具体答案。
今天大多数采购方评估人工智能的方式,和评估任何一项功能一样:看它运行一次。这恰恰是错误的检验方式,因为演示是事后加装的助手唯一能表现良好的环境。问题是挑好的,数据是干净的,而且一切都发生在单一产品内部。
真正的失败发生在之后,而且属于结构性问题,而非模型质量问题。前沿模型非常出色。真正区分平台的,是模型被允许看到什么、被允许做什么,以及它出错时会发生什么。
1. 它能否在没有集成的情况下回答跨两个模块的问题?
请对方回答一个同时涉及业务两个部分的问题。「本季度哪些客户存在风险,为什么?」是个好问题,因为真正的答案需要销售管道、支持历史、交付状态和发票。
有力的回答是针对单一数据模型的单次查询,而且厂商能够描述这次查询的形态。
无力的回答里会出现「集成」这个词,或者演示悄悄把问题收窄了:你问的是整个业务的风险,得到的却是仅从销售管道推出的答案。这种收窄就是信号。它意味着助手只能看到一个孤岛,而它看不到的那些部分,恰恰是会改变答案的部分。
2. 每条记录是否有一份为模型而非为数据库准备的表示?
依赖原始数据表行的人工智能,必须从列名推断含义。这在两张表用 status 表达不同意思之前都还管用。
有力的回答是:每个实体都会序列化成一份确定性的、理解自身模式的视图,专为模型消费而构建,并包含人类会视为理所当然的关联状态。在 Cyril 里这就是 ai_context 序列化器,它对每个实体都是强制的,而不是谁想起来就加在哪里。
无力的回答是「我们把记录传给模型」或者「我们对你的数据做检索」。文档检索是不错的补充,却是糟糕的替代:它回答的是曾经写下来的内容,而不是当下为真的内容。
3. 是否只有一套权限模型,人工智能是否继承它?
这个问题决定了人工智能究竟能不能面向全公司开启,而不是只给一个试点小组。
有力的回答是:人工智能以该用户的身份运行,使用相同的角色与记录级权限,看不到任何该用户自己打不开的内容。
无力的回答是一个拥有宽泛读取权限的独立服务账号,外加一句「提示词里写了让它守规矩」。提示词里的指令不是访问控制机制。如果支持人员与工资表之间唯一的屏障是系统提示里的一句话,那么模型不需要心怀恶意就会失守——它只需要乐于助人。
4. 是否只有一份审计日志,人工智能是否出现在里面?
在演示动作完成后,请对方展示审计轨迹,并留意人工智能的动作被记录在哪里。
有力的回答是:它与人类动作出现在同一份日志中,操作者被标识为「代表某位具名用户行事的人工智能」,与任何其他写入完全一样。
无力的回答是一个单独的「人工智能活动」页面。两份日志意味着,不交叉比对就没人能还原一条记录到底经历了什么;而在最需要还原的时刻——客户对某次改动提出异议、审计人员追问是谁批准的——靠时间戳去对齐两个系统,正是事实丢失的方式。
5. 人工智能的操作能否撤销?
答错一个问题浪费一分钟。做错一个动作则会把邮件发出去、把商机挪走、把发票冲掉。
有力的回答会描述一条属于平台而非属于人工智能功能的回滚路径:软删除、带版本的记录、多步事务写入——也就是让人类失误得以撤销的同一套机制。
无力的回答是「每一步都由用户批准」。批准是不错的控制手段,但不是恢复机制。人总会批准。问题在于,当有人批准了错误的那一次时会发生什么。
6. 产品之外的东西能否驱动它?
要检验一个平台的能力是否真正对人工智能开放,最实在的方式是看厂商没有编写过的智能体能否调用它们。
有力的回答是一套有文档的工具接口——MCP 服务器或与之等价的东西——其中提供给外部智能体的动作,与产品内部执行的动作完全相同,并受同样的权限约束。
无力的回答是一个 REST API 加一个耸肩。API 是必要的,但不是一回事:它暴露的是供开发者拼装的端点,而不是供智能体从中选择的能力。
7. 你能否在不更换产品的前提下更换模型供应商?
有力的回答是一层模型抽象,当前供应商只是被写成默认值而不是架构的一部分,并且按任务决定路由。
无力的回答是:厂商关于人工智能的叙事,和它的模型供应商,是同一个叙事。三年来,模型的能力与价格每隔几个月就大幅变动一次。一个必须重写才能享受这种变化的平台,最终不会享受到。
如何评分
七个问题,三种结果。
- 五个及以上有力回答。 人工智能在地基里。它现在还做不到的事属于路线图问题,而路线图问题是正常问题。
- 两到四个。 一个有能力的产品,外加一个挂在旁边的助手。它会在单个孤岛内做些有用的事。不要在它之上规划跨全公司的流程。
- 少于两个。 你买的是一个聊天窗口。这也可能仍然值得,但请按这个价值定价。
请注意,七个问题没有一个在问「回答有多好」。回答质量会随行业前沿自行提升。架构不会:没有人会为一个由五次收购拼起来的产品事后改造出单一数据模型,因为那次迁移的成本超过产品的全年收入。这正是这七个问题历久不衰、而「它有多聪明」并非如此的原因。
Cyril 的自评,如实相告
发布一份考卷却不参加考试,未免太便宜。
Cyril 在第 1、2、3、4、6、7 题上回答有力:销售、项目、支持、文档与财务共处一张图谱;每个实体强制带有 ai_context 序列化器;人工智能通过单一受治理的控制点、以调用者本人的权限运行;只有一份审计日志;一个把平台工具暴露给外部智能体的 MCP 服务器;以及一层没有把供应商写死在代码里的模型抽象。
在第 5 题——回滚——上,基础能力已经具备且每个模块都在使用:软删除、多步事务写入,以及每次变更都有的审计记录。仍在完善的是把多步人工智能操作作为一个整体撤销,而不是逐步撤销。
还有两点考卷没有覆盖、需要直说的事:Cyril 处于发布前阶段,而它完全自主的智能体模式即将推出、尚未交付。今天已有的是平台,以及一个在你身边工作、行动前先展示计划的人工智能助手。当你把这七个问题拿去问任何厂商——包括这一家——请同样要求他们区分清楚「已经存在的」和「计划中的」。
常见问题
「人工智能原生」只是市场话术吗?
按目前常见的用法,通常是。按本文的定义——人工智能与人一样,通过同一套数据模型、权限模型和审计日志进行读写——它是一项结构性属性,可以在一次演示中要求厂商兑现。
一个平台可以在之后变成人工智能原生吗?
人工智能这一层随时可以改进。而底下的单一数据模型实际上无法事后改造:它要求把产品重新奠基在一套模式、一套权限模型和一份审计日志之上,那是重写,不是发版。
这对小企业重要,还是只对大企业重要?
对小团队更重要。大公司可以雇人去对齐五个系统。四十人的团队做不到,因此它能向自己的数据提出的问题有多好,几乎完全取决于这些数据是否共享同一张图谱。
最快见效的问题是哪一个?
第 4 个。在人工智能做完某件事之后,立刻要求查看审计日志。这只花十秒钟,很难临时准备得令人信服,而答案会告诉你厂商对这份清单上其余所有问题有多认真。
如果你希望成为最早使用 Cyril 的用户,加入等候名单。
继续阅读
2026年8月31日 · 阅读时长 8 分钟
向人工智能厂商询问权限的八个问题
有风险的不是人工智能演示本身,而是它底下的权限模型——正是权限模型决定了这项功能能否走出试点小组。八个产品中立的问题,以及每个问题你希望听到的回答。
2026年8月28日 · 阅读时长 9 分钟
当开发团队是人工智能时,什么会改变
Cyril 是一个由人工智能构建、由一个人主导的完整业务平台。有意思的不是速度,而是让人工智能成为可靠开发者的那些做法,恰好也是让软件能被智能体安全操作的那些做法。
2026年8月25日 · 阅读时长 9 分钟
集成税:五套彼此独立的工具究竟要花多少钱
许可费并不是大头。这是一份公开的、逐条列出假设的测算,说明用五套彼此独立的系统跑销售、支持、文档、项目和财务到底要付出什么,包括人工智能出现之后才有的那一条。
分享这篇文章