别急着增长:先回答 AI 产品到底有没有变好
AI 输出具有不确定性。没有评测体系,增长只会把不知道好坏的体验更快地放大。
罗文宇 ·
传统软件的一个按钮修好以后,大多数用户会得到相同结果。AI 产品不是这样。一次提示词、模型或知识库的调整,可能让一部分场景明显变好,同时让另一部分场景悄悄退化。团队如果只看几个漂亮案例,很容易把偶然当成能力。
所以在讨论拉新和留存之前,我更想知道:我们怎样证明版本变好了?这不是算法团队独有的问题,而是产品定义的一部分。
评测要从用户任务出发
“回答准确率”通常不够。客服要看是否解决问题、是否减少转人工后的重复沟通;内容工具要看用户修改了多少、是否愿意使用结果;陪伴产品还要评估边界、安全和长期感受。指标必须对应用户最终想完成的事。
模型指标告诉你机器表现如何,产品指标告诉你用户有没有得到结果。
一套实用评测可以分三层:离线样本保证基本能力和回归;线上行为观察真实任务完成;人工抽检处理那些机器难以判断的语气、事实和风险。三层互相校正,不能靠单一数字替代。
失败样本比平均分更有用
平均分上升并不代表高代价错误消失。团队需要建立失败分类:知识缺失、意图误判、工具调用失败、语言不合适,还是产品本身给了模型不可能完成的任务。每一类失败对应的解决办法不同,有些要调模型,有些应该改流程,有些则应直接限制能力。
增长是放大器。在你知道什么体验值得被放大之前,增长越快,付出的返工和信任成本可能越高。先建立判断好坏的能力,再让更多人进来,这不是保守,而是更有效率。