
开季度会的时候渠道总监忽然问我“用户在AI那边问选型会不会提到咱们”会议室安静了三秒。这个问题的答案当时我们谁都不知道。那时候公司上下能拿到的数据还是传统的舆情声量、搜索指数、电商份额但用户获取信息的路径早就变了。越来越多的人打开对话框直接发一句“我家养猫预算三千以内扫地机器人选哪个”然后照着AI给出的清单做决策。品牌如果在这些回答里消失了那不是在某个渠道少了一条曝光而是在用户心智里直接隐身。所以我决定自己搭一套AI可见度监测用4196次实测去回答一个问题当用户询问AI时我们品牌到底有没有被提及、被推荐、被放到什么位置。整件事做完之后我不光拿到了一份“引用缺口”清单还顺手沉淀了一套可以复用的小型监测框架。这篇文章就把完整的搭建过程、参数设计、踩坑实录都拆开讲清楚想做的朋友可以直接照着抄作业。1. 为什么盯上AI可见度搜索迁移下的品牌盲区1.1 AI回答正在变成新的心智入口先别急着讨论技术我们先理解一个足够现实的变化。过去十年品牌做认知监测核心看搜索。用户在百度也好、在电商平台也好输入“空气净化器怎么选”排在前面的品牌自然获得更多点击和信任。这套逻辑背后的假设是搜索引擎是用户决策的第一站。但这个假设正在松动。我身边很多朋友尤其是25到35岁这个区间已经开始把日常消费决策类问题直接丢给AI。问产品差异、问价格带、问优缺点对比甚至是“同事来家里聚会用什么咖啡机更合适”这种极其具体的场景问题AI都能给出结构化的回答。而且这类回答和搜索结果页不太一样它是收敛式的往往只给三到五个选项用户几乎不会翻页。这就带来了一个品牌人必须接受的现实AI的回答列表正在成为新的心智货架。货架上有没有你的品牌排在第几个描述是正向推荐还是中性带过直接影响用户下一步会不会主动搜索你。以前我们拼的是搜索引擎里的排位现在要拼的是AI回答里的“被提及”。这件事我称之为AI可见度它和传统的搜索可见度相似但底层逻辑又完全不同。1.2 传统声量监测够不到的“引用死角”我们公司的舆情后台其实一直开着每天能抓到几千条关于品牌的讨论涵盖社交媒体、新闻站点、论坛帖子和电商评价。这套体系本身没什么问题但当我试着用它回答“AI里我们品牌在哪里”的时候发现完全是另一回事。传统舆情监测抓的是“存量内容”是已经被人写出来、发出去的文本但AI在对话时生成的回答是“实时产物”。它不在某个网页上等着抓取而是根据用户的提问临时组合出来的。你今天问它“推荐一款适合程序员的人体工学椅”它可能提到了A品牌明天同一个问题换个措辞可能就变成了推荐B品牌。这种动态性传统爬虫和关键词监测根本覆盖不到因为那些品牌压根没有在公开网页上产出新内容它们只是存在于模型的参数和偏好里。另一个死角是语境。搜索引擎的结果页品牌排位是明确可比的第几位一目了然。AI回答不一样它有时候会把品牌放在正文里作为举例有时候放在末尾的“其他选项”里有时候甚至只是暗指“某主打性价比的品牌”。这种语境上的差异用关键词统计很难量化。这也是我决定从零搭一套新监测的原因——不是取代传统舆情而是补上它看不见的那一块。1.3 所以我决定自己搭一套低成本监测确定方向后我给自己定了三个原则第一必须是量化数据不能靠感觉每一次提问都要有记录第二必须能定位到具体缺口不光是“可见度低”这种废话而是要知道在什么场景、什么问题下丢了第三成本要可控毕竟是内部探索性项目不可能像咨询公司那样上来就买几十万的定制解决方案。抱着这三个原则我拉了一个基础框架构建查询语料库设计评分模型用API批量执行实测最后用差距分析去定位引用缺口。整套流程跑完累计完成4196次真实问答测试。这篇文章后面写的所有数字、结论、坑都来自这4196次实测。2. 从零搭建监测体系词表、频次与评分模型2.1 第一步先把查询语料库搭对监测的第一步不是写代码而是把要问的问题想清楚。AI回答的结果高度依赖提问方式所以查询语料库是整个项目的灵魂。语料库搭得不对后面跑再多测试也是白搭。我按语法把问题拆成了四类词根品牌词、品类词、场景词、竞品词。品牌词就是自己的品牌名加核心产品线名用来测“AI知不知道我们”品类词是“扫地机器人”“人体工学椅”这类行业通用词用来测“AI推荐品类时会想到谁”场景词是“养宠家庭适合什么吸尘器”“百平房子装修甲醛怎么办”这类高价值消费决策场景用来测“AI在具体情境下会不会引入我们”竞品词则是直接拿竞品品牌名去对比用来测“同一问题上我们和竞品的相对位置”。这里有一个很容易踩的坑场景词不能靠拍脑袋必须从真实用户评论和客服高频问题里去提取。我翻了一个月的售后工单和电商评论把用户反复提到的场景整理成清单。比如吸尘器品类下“养猫掉毛”“车里吸灰”“高处窗帘”这三个场景出现频率最高那这些就必须进语料库。相反如果某类词汇只是团队内部觉得重要用户根本不这么问那测出来的数据再漂亮也没有业务意义。2.2 4196次实测是怎么分配出来的4196这个数字乍一看很唬人其实就是把语料库乘上轮次得出来的。我习惯用表格管这个结构清晰后面复盘也方便。测试块组成轮次实测次数核心品类矩阵12个品类词 × 8种意图问法25轮2400竞品对比测试8个竞品 × 15种典型问题10轮1200品牌词求证8个品牌词 × 12种提及场景6轮576冷启动探测跨品类泛问20题1轮20合计——4196为什么要跑这么多轮核心原因是LLM输出有随机性。同一个问题问十次可能得到六种排列组合品牌出现的次数也会有波动。我最初只跑3轮发现数据抖得厉害一个品牌上一轮还在首位下一轮直接消失。后来把核心矩阵提到25轮统计结果才稳定下来单品牌的提及率波动控制在5个百分点以内。至于竞品对比和品牌词求证因为问题数量更多每轮的边际成本也更高10轮和6轮是兼顾稳定性和成本的选择。其实做这类测试最忌讳的是贪多但分布不均。宁可核心问题跑够25轮也别用10个问题各跑100次那种做法。不同问题之间的变化才是我们要捕捉的信号。2.3 可见度评分从“提没提”到“怎么提”原始数据只是回答文本要把文本变成可对比的指标必须建立评分模型。我这套评分模型设了五个维度从单纯的数量统计逐步过渡到质量判断。第一个维度是提及率计算方式很简单某个问题集合内品牌名出现在回答里的次数除以总测试次数。这是最基础的指标用来回答“AI到底知不知道我们”。第二个维度是首位置率。AI列推荐清单时第一个被提到的品牌占据最强心智位置。我统计的是品牌出现在首个推荐位或整段回答前30%位置的概率这个指标比提及率更残酷因为它是零和竞争——首位置只有一个。第三个维度是推荐强度。同样是提到品牌AI可能说“X是个不错的选择”也可能说“X是这些选项中最符合你需求的一款”。前者是中性列举后者是明确推荐。我按句法特征做了三层分级强推荐、弱推荐、纯列举然后赋分1.0、0.5、0.2。第四个维度是语境情感。AI在提到品牌时有没有带上正面标签比如“续航能力突出”“售后口碑好”是正面语境“价格偏高”“存在品控反馈”是风险语境“可以关注一下”是中性语境。这个维度我会用人工抽检配合规则匹配来做不追求100%准确只要能反映趋势就够了。第五个维度是综合可见度分。把前面四个维度的标准化分值做一个加权求和权重分别设置为提及率30%、首位置率30%、推荐强度25%、语境情感15%。做完加权之后每个品牌在每个问题上都能得到一个0到100之间的分数横向可比纵向也能做时间序列跟踪。3. 跑完全程采集、解析与缺口定位3.1 用API批量执行别手动提问做完词表和评分模型接下来就是采集。这里我要强调一句一定要用API批量执行千万别让实习生开几个网页手动问那不仅效率低得吓人还会引入大量不可控因素。我在采集层用的是国内大模型开放平台提供的标准API接口调用聊天补全功能格式是现在通用的messages结构。核心参数就三个模型型号、temperature、system prompt。模型型号选了通用能力比较稳的那个版本temperature设成0.2。这里解释下为什么不是0。温度设成0确实能最大程度降低随机性但也会让回答变得机械且部分模型对重复输入会产生规律性输出反而失去采样多样性。设成0.2既能保持稳定又保留了正常对话的语感。采集端的代码逻辑不复杂封装一个函数处理单次提问import os from openai import OpenAI client OpenAI( api_keyos.getenv(LLM_API_KEY), base_urlos.getenv(LLM_API_BASE), ) def ask_ai(prompt: str, temperature: float 0.2, model: str qwen-plus): resp client.chat.completions.create( modelmodel, messages[{role: user, content: prompt}], temperaturetemperature, ) return resp.choices[0].message.content拿到文本后再加一层轻量的结构化解析。我用了两种方式配合一种是品牌名精确匹配把品牌全称、简称、产品线名称都纳入匹配词表第二种是位置抽取记录品牌名第一次出现在整段回答中的字符偏移量用来判断它处于开头、中段还是结尾。这块直接写正则和字符串查找就够了不需要上复杂的NLP模型。整个采集过程我加了两重防御一是每个问题之间随机睡眠1到3秒避免触发限流二是把每轮结果实时写入JSONLines日志文件关键时刻自动重试一次。跑了4196次最终只有不到0.5%的问题因为超时被重试整体稳定性还算满意。3.2 解析环节区分提及、推荐与排位数据采回来之后最忌讳的就是把“提到了”和“被推荐了”混为一谈。举个真实例子我们有一个产品在“性价比高的XX推荐”这类问题里提及率超过60%排名也不错但用户如果继续追问“品质最好的是哪个”它出现的概率不到10%。如果只看平均提及率会觉得品牌表现不差但拆分到具体意图之后才发现我们在“品质优先型”用户群里几乎隐身。所以我做了解析分层。第一层用关键词规则把回答切成三个区块核心推荐区、补充说明区、最后附注区。核心推荐区一般是回答开头直接列的清单或者句子里出现“推荐”“首选”“适合”等词引导的实体补充说明区是具体的优缺点分析附注区是“此外”“还可以关注”这类尾巴。然后品牌出现在不同区块赋不同权重。第二层做竞品相对位置分析。针对同一个问题把所有竞品的提及情况拉平对比计算我们处在第几顺位。这里有个值得注意的规律AI的推荐清单往往是2到5个品牌如果你的品牌不在前三个位置基本就不会被用户继续追问。所以我就设定了一个“前三率”指标专门统计品牌落在推荐前三位的概率比单纯提及率更贴近真实决策影响力。手工验证这块我抽了大概200条结果做了标注规则判断和人工判断的一致率在90%左右。剩下10%的差异主要是两个原因一是一些品牌简称有歧义比如某个产品线的名字同时也是行业通用词二是AI用了隐晦的说法比如“这些年口碑不错的那个国产品牌”规则匹配不到。对这类边缘情况我没有追求百分百完美而是统一归入“模糊提及”类别单独统计不进主体评分。3.3 三类典型引用缺口是怎么被定位出来的有了评分和解析结果最重要的一步来了——定位引用缺口。我采用的方法是差距矩阵横向是问题类型纵向是竞品和自我的对比找出“应该被提及但实际缺失”的位置。跑完这4196次实测我整理出了三类典型缺口。第一类是场景型缺口。品牌在品类词下提及率尚可但在高价值场景词下几乎消失。比如我们某个智能家居品牌用户直接问“扫地机器人推荐”时出现率有28%但问“家里有地毯和宠物怎么选扫地机器人”时出现率跌到6%。地毯加宠物是多猫家庭最典型的组合场景这个场景下消失意味着我们前半段的内容铺垫没有传达到模型偏好里。第二类是压制型缺口。品牌在特定问题上没有被完全绕过但总是排在竞品后面一位。最典型的是“便宜好用的蓝牙耳机”我们品牌的综合提及率有45%但前三率只有18%每次都被两个竞品稳稳卡在前面。这说明模型对“便宜”这个标签的关联认知更倾向于竞品。必须靠大量带有“平价”“学生党”“性价比”标签的内容去对冲。第三类是语境型缺口。品牌提倒是被提到了但伴随的是风险标签而非正向标签。比如某个品牌被AI提及的句子往往是“虽然性能不错但品控投诉较多”或者“售价偏高适合预算充裕的用户”。这种情况下提及率甚至很高但实际效果反而是劝退。后来我们专门针对品控和售后场景做了大量正向内容布局三个月后语境情感分才从负转正。4. 排坑实录这几个问题差点毁掉整组数据4.1 上下文污染会让后面几十次查询全部失真第一次批量测试时我犯过一个极其低级的错误为了省调用次数我把好几十个问题塞在同一个会话里靠连续对话连续追问。结果数据出来一塌糊涂某个竞品的提及率莫名飙升到75%后来才发现是因为会话太长模型已经“记住”了前面几轮我反复问到竞品名字后面的回答一直在延续前面的语境。这就是上下文污染。后来我的解决办法很简单每次提问必须开全新会话不传历史消息。每一次调API都只带一条user消息整个对话历史就是一句话模型没有多余的背景信息可以“借鉴”。这样做的代价是每次调用都要重新计算完整上下文成本会高一丢丢但数据干净程度完全是两个级别。做任何AI可见度类监测这条必须写死在工程规范里。4.2 模型一更新上一轮的结论就不能再用还有一个坑是模型版本漂移。我们的监测跑了将近一个月到中后期我对比数据时发现某些品牌的提及率出现了莫名其妙的整体抬升。排查了很久最后发现是底层大模型版本在期间更新了。新版本对某些品牌名称的语料记忆更强同一问题下回答结构也变了。这不是我们的监测操作变了而是评测环境变了。这意味着跨时间对比时必须把模型版本作为关键维度记录在案。我现在每个批次的元数据里都存了model版本号做趋势分析时只对比同一版本下的数据。跨版本对比只用来观察相对格局变化不会用来做绝对数值判断。如果你打算长期监控建议固定一个版本跑至少一个季度中途别追新不然数据会变得很碎片化。4.3 成本控制的三个实操准则最后聊成本。4196次实测如果全部用通用模型API按次数计费其实价格远比你想象的低——正经跑完全部测试花费大概是两位数的金额但是对于更长周期的监测这个成本会线性累积几个月下来也是不小的一笔。我的成本控制经验有三条。第一冷启动阶段先用少量问题验证流程跑个50次就行别一上来就铺量等解析逻辑稳定了再上全量。第二高频问题可以缓存结果同一个问题在短期内重复出现的概率不高但隔一段时间重新测试时可以先用上次的结果判断是否有必要重测——如果上一轮该问题没有明显波动就适当降低重测频率。第三精细拆分模型选择不是所有问题都要用最高配的模型简单的品牌词出现在不在的判断题可以用轻量模型跑需要衡量推荐强度和语境情感的问题再用高配模型跑。分档调用能省不少预算。做完整套餐监测之后我个人最大的体会是别把AI可见度监测当成一次性的咨询项目它本质上是一条需要持续运行的数据管道。第一轮4196次实测帮我找出了场景型、压制型、语境型三个方向的缺口后续每季度复测一轮盯着同一批指标看趋势才能知道优化的内容到底有没有被模型“记住”。另外建议所有刚起步的朋友不要一上来就追求大而全的体系先挑品牌所在的1到2个核心品类每个品类搭20个问题、跑上50轮测试把流程跑通、把评分口径跑稳再慢慢扩展。这套方法的门槛没有想象中高关键是把问题设计好然后坚持记录每一次输出。