让AI回答“智构星河是做什么的”,与询问“企业做软件定制时怎样找服务商”,会检验不同的事情。前一个问题已经给出品牌,后一个需要在没有品牌提示的情况下发现相关服务商。测试时把两类问题混在一起,就难以判断结果说明了什么。

2026年9月17日,我们针对当时的官网website-v0.3.3,用固定的company-discovery.v2问题集,在ChatGPT、DeepSeek、豆包和腾讯元宝的网页端进行了一轮测试。每个平台8题,共32个题格。这里记录的是当日结果,不能当作当前官网版本的表现,也不用于给各平台排优劣。

原题、条件与结果一起保存

测试分开记录带品牌的问题与不提供公司名的自然发现问题。每条观察保留题号、平台、时间、内容版本,以及联网是否确认等条件。原题测试采用独立新对话。

本轮共尝试32格,其中31格确认联网且满足本轮有效观察条件,另1格未确认实际联网,单独标记。各平台使用当时可用的登录账号,账号、地区和个性化条件没有完全统一;因此结果不能解释为所有用户看到相同答案的概率。

左右滑动可查看完整表格

问题类别尝试与有效情况本轮结果
带品牌的问题尝试20格,有效19格,1格联网未确认准确描述5格,引用官网5格;这两项不能简单相加
自然发现问题尝试12格,12格有效没有一格提及智构星河

准确描述和官网引用各5格,均出现在本轮ChatGPT的品牌题中。这是该批次观察,不意味着这些结果在另一账号、另一天或另一轮一定重现。完整回答和账号会话没有公开,公开的是固定题目、方法及汇总。

这个结果改变了我们怎样判断工作

品牌题中存在准确描述和官网引用,可以说明部分回答读取或引用到了相关官方信息。但12格自然发现题均未提及公司,因此这轮没有建立自然推荐结论,更没有证明稳定召回。

另一个需要分开的动作是给模型提供官网地址,请它分析页面。这样的沟通可以帮助检查表述是否清楚、是否有信息缺口;由于地址已经提供,回答中的网站引用不能计入“自然发现”。

据此,我们把后续工作分为两部分:一部分是把公司、产品、服务和官方入口说明清楚;另一部分是根据实际服务问题补充有用内容,再按原题复测。9月19日新增服务问答属于后续内容改动,本文没有将这次改动归因为模型效果提升。

企业可以怎样记录自己的测试

下面是一份简化的记录字段,适合先建立小规模基线:

记录字段用途
原问题与题号避免改了问法后仍声称是同一题比较
是否给出品牌或网址区分品牌识别、自然发现与地址诊断
平台入口、日期和联网情况保留测试发生的实际条件
当时的网站内容版本避免将旧内容结果归到新页面
是否提及、是否准确、是否引用官网分别判断名称出现、事实质量与来源
原件与复核记录能回查回答依据,保留负向与不确定结果

先记录完整一轮,再在后续时间使用相同题面复查。出现缺少联网确认等条件时保留为未确认,不为了凑齐统计把它记成有效失败。

本次公开资料可见固定问题集2026年9月17日测试方法及汇总。这些是智构星河自己的测试资料,属于第一方记录。服务交付范围见GEO/SEO服务页