• +1

比数字泔水更可怕的是“能力泔水”

2026-09-25 09:16
来源:澎湃新闻·澎湃号·湃客
听全文
字号

垃圾内容污染的是注意力,垃圾能力污染的却是工作流。当越来越多Agent和Skill看起来“什么都会”,真正的问题来了:这里面到底有多少,真的敢让它干活?

你现在打开短视频平台,随便刷上10条,有多少条缺胳膊少腿的AI怪异视频,有多少条虚构、捏造的假新闻,又有多少条耸人听闻的“伪健康科普”?

对于这些垃圾内容的声讨,最近一段时间在媒体和社交平台上爆了,还有个专有名词:“数字泔水”(Digital Slop)。

不过,前几天和几位媒体老师一起吃饭,他们提出了一个更让人心里发凉的判断。

大概意思是:现在看到的内容垃圾,只是“初级泔水”。更要命的,是现在各大平台里的Agent和Skill商店,已经开始批量生产“能力泔水”了。

初级的数字泔水,污染的只是人们的注意力,而“能力泔水”,污染的是经济社会的工作流——它假装自己是一个能帮人干活的能人,关键时刻却在底座里拉一把大的。

我一个做跨境电商的朋友,就吃过这样的亏。他们公司为了提效,网上找了个“智能发票与报关单对账Skill”。看介绍功能很全:自动解析PDF、自动匹配汇率、自动生成勾稽表,宣称能省下两个财务的人力。

结果用了半个月,财务去抽查,发现中间有三笔大额单子的进项税额全算错了。后来找专业人士看了下,发现这个Skill就是外接了一个免费的汇率接口,结果那个接口改了数据结构,而这个Skill既没有报错机制,也没有容错处理,结果就是一路错了下去。

这个,就叫“能力泔水”。

这种动态的“有毒自动化”,比静态的文字垃圾更可怕。

现在各大平台都在建设各种skill商店,那随着这些商店的逐渐完善,能不能遏制能力泔水的出现和泛滥?

答案恐怕是否定的:越是按传统“商店/货架”的逻辑去建Skill商店,能力泔水就泛滥得越厉害。

真不怪开发者偷懒,也不是平台审核员不够用心。根本原因在于:大家都在抄苹果App Store的“货架思维”,但这套模式套在大模型时代的能力分发上,从底层逻辑开始就错配了。

首先,移动互联网时代,开发一个App,需要写代码、调UI、搞运维,天然有极高门槛。但现在“自然语言即编程”,一个人花三分钟调一段Prompt,就能打包挂上商店。供给成本趋近于零,后果就是整个商店瞬间陷入极度熵增。

在App Store上,传统应用有相对稳定的代码、权限、版本和测试环境,审核标准也更容易固化。但Skill往往由Prompt、模型、工具、外部API、数据源和工作流共同组成,运行结果还会受到接口、网页和模型状态变化的影响。

仅仅检测Prompt是否违规,无法充分验证它在真实场景下的稳定性和任务完成率。目标网站改版了,接口限流了,甚至大模型今天刚好“幻觉”一下,昨天100分的Skill,今天就变成了毒药。

更要命的是,传统的打分和评价机制彻底失真。最后的结果,就是看上去商店里摆满了4.8分的能力,但用户买单试水两三次,发现全是关键时刻掉链子的“泔水”,信任感瞬间崩塌。

那么,这事儿就无解了吗?

倒也不是。有一个办法,就是把Skill从“商店”里拿出来,直接扔进真实业务里试。

从这个角度看,百度搭子开放平台最近的一些做法,挺值得观察。

百度搭子并不是只搭一个Skill货架,而是开放连接器、专业Skill和场景共创三层能力,同时提供开发支持、上架认证、场景分发和数据反馈。在这类基于真实企业场景构建的生态体系里,“能力泔水”的生存空间被压缩得极其厉害。

这并不是因为平台管得严,而是因为企业级的实操场景,从机制上提供了三种天然的过滤器。

机制一,考核标准从“看眼缘”转向了“看ROI与业务结果”。

在C端商店里,一个Skill靠花哨的描述和营销套路就能换到下载;但进入企业场景后,评价标准会迅速变硬:能不能接入真实流程、稳定完成任务、输出可核验的结果,最终还要看能不能创造实际业务价值。

泰康就是一个例子。其已在智能体开发平台上线了3500多个智能体,去跑医疗风控、展业合规这些核心场景。

只要涉及真金白银和具体业务,过滤机制就一定变得极其残酷。对企业而言,调用量、任务完成率、实际业务结果,最终都会成为比“点赞”和“评分”更硬的评价指标。

机制二, 能力供给从“一段Prompt”,转向数据、工具和工作流的组合。

普通Skill商店里90%的泔水都是“一段Prompt+简单描述”;而真正能在百度搭子平台上跑起来、被企业买单的搭子,极其沉重。

就像福建蓝海黑石新材料CIO张明杰分享的例子:他们要把AI嵌进生产体系,不是扔个提示词就完事,而是让百度搭子深度向下对接SAP、WMS、PLM等系统数据,同时结合外部原材料行情,输出趋势判断、风险提示和采购建议,把几天的人工分析变成一份可核验、供决策参考的结构化报告。

开发者必须把搭子深深地嵌进企业的业务系统里,对接私有数据库、调取系统接口、绑定复杂的业务逻辑节点。当评价对象从“一段写得漂亮的Prompt”变成一套能够在真实流程中运行的能力组合,“一键套壳”的垃圾供给自然就失去了滋生的土壤。

机制三,真正的业务流程容不下“概率试错”。

在企业级业务流程里,一个产生幻觉、执行中断的“泔水搭子”,很可能就是一场实打实的业务事故。

这就逼着平台和开发者必须在底座上下死功夫。比如,百度搭子在PinchBench测试中中取得93.3%的总成绩。而最新的消息显示,百度搭子的任务完成率达到99%以上,积分消耗降低30%。只有经过持续的工程压测和Harness引擎调优,把“坏螺丝”提前筛掉,才敢真正放到生产线上去干活。

这类模式其实说明了一件事:治理“能力泔水”,光靠后置的人工审核很难解决,真正有效的过滤器,还是严肃的生产力场景。

玩耍的“沙盒”和干活的“工具”,终究应该分开,采用不同的验证标准。

前者可以允许试错,后者必须经得起真实业务的检验。到了这一步,AI能力才真正有了商业价值。

    本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。

    +1
    收藏
    我要举报
            查看更多

            扫码下载澎湃新闻客户端

            沪ICP备14003370号

            沪公网安备31010602008124号

            互联网新闻信息服务许可证:31120170006

            增值电信业务经营许可证:沪B2-2017116

            © 2014-2026 上海东方报业有限公司