AI搜索中的问题库建设:从用户问什么到系统答什么
前两天测试AI搜索,问了个特别冷门的问题“老式收音机的旋钮手感为什么那么扎实”,结果AI给我答了一堆关于射频电路的内容。我整个人懵了。说实话,这类例子我见太多了。问题不在模型,也不在语料,很大程度上,是问题库没建好。
可能有人觉得,AI搜索不就是把问题扔给大模型吗?还真不是。你要是想让AI稳定地“答你所问”,它得先知道你通常怎么问。问题库就是干这个的——它不是一个简单的FAQ表,而是一套“用户提问行为”的数据库。里面记录着真实用户的话术、句式、甚至错别字。
一、先把“问法”攒起来
别急着上模型,先扒拉真实的用户提问。去搜索词报告、客服聊天记录、知乎评论、甚至贴吧帖子里把那些原生态的问题都捞出来。这一阶段最重要的一个字:脏。什么“这个怎么弄”“xx是哪家的”“求推荐”全都要留。然后做归一化,把同义不同写的问法归到同一个意图下。你可能觉得这一步很傻,但往往越傻的事越管用。

举例说,有人搜“苹果手机怎么连蓝牙”,有人搜“iphone连不上蓝牙怎么办”,还有的直接写“蓝牙连不上,苹果机”。这三条看起来八竿子打不着,但归一化后,都是一个意图:iPhone蓝牙连接故障。问题库的粒度就体现在这儿。
二、给问题分层:不能一锅炖

有的问题就是来“查事实”的,比如“苹果公司成立于哪年”;有的问题是要“求方法”的,比如“怎么做红烧肉”;还有的是“求推荐”的。这些必须分开处理。因为它们对应的答案结构完全不一样。查事实的直接给时间点+来源就行;求方法的得给步骤;求推荐的得给对比和理由。如果问题库是平铺的,AI只能拿一个模板去套,结果就像你跟人聊天,对方永远只会“嗯嗯嗯”。
我们当时检查过某搜索产品,发现它把“哪个牌子的空调好”和“空调怎么选”归成了同一类,结果答案里全是参数对比,但没人告诉你怎么打开过滤网。你说气不气人。
三、动态更新:问题库是活的
搜索引擎每天进来几十万条新问法,问题库只靠人工维护,累死也跟不上。所以得有个自动挖掘的闭环:新问题进来,先跑一遍聚类,筛出明显的高频问法,然后人工抽检,再回流到库里去。这个过程不用太复杂,但必须定期跑,不然问题库就僵了。
有个好玩的例子:去年突然流行“city walk”这个词,如果问题库没更新,用户搜“城市漫步路线”或者“周末走走哪里好”,AI可能都反应不过来。但你要是能抓住这种新概念,把相关问法都绑定上,体验立刻就上来了。

四、问题和答案不能脱节
很多团队建问题库,只攒问题,不盯答案。结果AI找到问题了,但返回的答案还是老旧的模板。问题库要跟知识库引擎联动,答案页的点击率、跳出率都要反馈回来,反过来修正问题库的权重。比如某个问题,用户问了十次,有八次都点了同一条结果,那这个问题就该往那个答案上靠。
我们之前帮欧博东方做搜索优化时,就遇到过这种事儿。他们的业务里有个高频词,用户通常叫“风控审批”,但系统里存的是“风控审核”,就差一个字,AI就死活答不上来。后来建了个同义字典,把两者绑定在一起,问题库瞬间就通了。这种事特别多,别指望AI自己懂,你不把问题库建好,它就永远在那儿绕。
五、这玩意儿不是万能的
问题库也有搞不定的时候。比如小语种和方言,很多聚类算法一碰到广式普通话就直接崩;再比如隐私敏感的行业,用户问题里带着病历或合同内容,你根本不敢拿出去训练;还有那种开放式的、没有标准答案的问题,比如“这份合同值不值得签”,问题库只能帮你把范围缩小,给AI一个“思考框架”,但最终结论还是得靠模型自己发挥。
所以问题库建设,听起来像个脏活累活,但恰恰是AI搜索体验的分水岭。你见到的那些“聪明”的搜索产品,背后多半有一个人在默默整理问题库。绕不过去。
未来这东西会越来越自动化,但人工的角色不会消失,只是从“搬砖建库”变成“监督调优”。谁先把问题库这个基础设施做好,谁就能在AI搜索的牌桌上多握一张牌。
说到底,AI搜索拼的不是算力,是你对它“懂你说什么”的训练。问题库,就是那本训练手册。
欧博东方