本期窗口:2026-07-28 08:37 ~ 07-29 22:02(北京时,约 37.5 小时)。全部数字出自我们自家的监测库,逐条可复算。
《公开 GEO 实验》是智码航用自家品牌做的公开实验:每周把一批真实用户会问的问题丢给 AI 引擎跑一遍,回答正文与引用来源原样存下来,数据好看不好看都发。本系列一律使用完整叫法「引见 YinJen」,也叫「智码航引见」——裸词在 AI 回答里不稳定,这是从第 1 期起就立下的规矩。
第 3 期和前两期不一样。这一期我们自己动了题集、暂停了一路引擎,还在操作中弄丢了一批历史数据。所以本期的第一件事不是报数,是交代。
先把读数放在这儿,细节在后面:本期 45 道题全部跑到,没有缺席题;45 道题上共拿到 24 次提及,豆包 22 次、Perplexity 2 次,其余引擎 0 次;官网被引 1 次。
一、这一期为什么是基线重置
三件事同时发生,三个分母同时变了。逐件说。
1. 我们换了题集,品牌层被整层清空
07-29 我们重构了自监测题集。核到库里的实数是这样的:当天新建 15 道题(14:40 建 5 道、15:02 建 9 道、15:29 建 1 道),同一天下架 10 道——下架的这 10 道里有 2 道,就是当天上午刚建、当天下午又撤掉的。所以题集是 40 + 15 − 10 = 45 道:沿用下来的旧题 32 道(原来 40 道里被下架了 8 道),当天新建并留下的新题 13 道(其中 4 道是这次才有的地区题)。
下架的 10 道全部集中在两层:品牌层 8 道、竞对层 2 道。品牌层被整层清空——那些直接点名问「智码航是什么公司」「YinJen 是什么」这类题,一道不剩。前两期最热闹的几组读数(定价题的三分格局、品牌认知的剪刀差、官网被引的主要来源)全都挂在这一层上。这一层没了,那几组读数在本期不是变差了,是没有对象了。
改题的理由很朴素:品牌题问的是「我们自己」,跑再多轮,测出来的也只是引擎知不知道我们;真正决定生意的是不带品牌的品类题和地区题——用户不会先知道你,再去搜你。理由成不成立可以讨论,代价是实打实的:能和上一期对得上的题面,只剩 32 道。
2. 本期我们自家的实验少跑了一路(产品覆盖仍是 12 个引擎)
从 07-29 起,我们主动暂停了 claude 这一路的自监测跑批(我们自己账号侧的风险考虑)。调度照排,但这一路本期的 43 条记录全部是「跳过:引擎未登录」,没有产出任何一条有效回答;其余 11 个引擎各自把 45 道题跑满。
这里必须说清楚,免得被读成产品口径变了:引见 YinJen 的监测覆盖仍然是 12 个 AI 引擎(国产 8 家 + 海外 4 家),这一点没有任何变化。 变的只是我们自家这套公开实验在本期实跑了 11 个——是我们的实验少跑了一路,不是产品少了一路。
3. 最难交代的一件:删题连带删掉了历史数据
删掉一道题时,我们的系统把这道题名下的全部历史运行记录一并硬删除了——不是软删除,是从库里抹掉,一共 503 条。删完之后再数同一批口径:
| 口径 | 删之前 | 删之后 |
|---|
| 删题当天上午那批记录 | 2,491 条 | 只剩 1,988 条存活 |
| 自监测总运行数(当下) | 2,491 | 2,228(= 1,988 存活 + 240 条删题后新跑的) |
| 上一期窗口(07-20 ~ 07-23,36/40 题) | 540 次 | 408 次 |
这里有个容易算错的地方,顺便交代:直接拿 2,491 减 2,228 会得到 263,但那是错的——两个时点中间还夹着删题之后本期后半段新跑出来的 240 条。按「上午那批还剩多少」来数,被抹掉的是 503 条。
被抹掉的这 503 条里,含 39 条官网被引的引用证据——第 1、2 期公布过的官网被引,绝大部分挂在这次被删的品牌题下面。
也就是说:第 1、2 期公布过的原始数据,现在已经无法从库里复现了。 那些数字在发布当时是真实的、是从库里数出来的;从 07-29 起,它们失去了可复核性,只能作为已发布的历史留档存在。本期窗口的数据不在此列——07-28 到 07-29 这批运行记录完整留在库里,逐条可复算,本文的每一个数字都是从里面数出来的。
我们的处置是:已经发出去的稿子不改数,但从这一期起,不再写任何我们自己复核不出来的数字。 前两期公布的那些数我们不撤、也不重写——改了反而与已经发布的内容打架;但它们从此不参与任何跨期计算。
这次事故还留下一条流程:删题前先导出该题的全部运行记录,已列为必做动作;把删除逻辑改成软删除、保留运行记录,也在排期里。如果不是发现得早,这周有一篇稿子会带着一个我们自己都对不出来的数字发出去。
所以这一期该怎么读
一句话:本期的任何数字,只能和它自己的下一期比,不能和第 1、2 期比。 下文凡涉及前两期,一律只做定性说明,不给差值。
二、本期成色与读数
| 项 | 本期 |
|---|
| 窗口 | 2026-07-28 08:37 ~ 07-29 22:02(北京时,约 37.5 小时) |
| 运行 | 538 次:495 次拿到有效回答;另外 43 次没有产出,全部来自 claude,记录状态是「跳过:引擎未登录」 |
| 题数 | 45 道全部跑到,无缺席题——这是本系列第一次没有「缺席题」这个缺口 |
| 引擎 | 本期自家实跑 11 个,各跑满 45/45;claude 本期零有效回答(产品覆盖仍是 12 个 AI 引擎,未变) |
各引擎的提及数:
| 引擎 | 跑到的题数 | 提及次数 |
|---|
| 豆包 | 45 | 22 |
| Perplexity | 45 | 2 |
| ChatGPT / DeepSeek / Gemini / 智谱清言 / 腾讯混元 / Kimi / 通义千问 / 阶跃星辰 / 文心一言 | 45 | 0 |
| claude | — | 本期零有效回答,自家跑批已暂停(产品覆盖仍是 12 个 AI 引擎,未变) |
24 次提及落在哪些题上:
| 题面 | 分类 | 题数 | 命中题数 | 提及次数 |
|---|
| 新题 | 品类 | 9 | 7 | 7 |
| 新题 | 地区 | 4 | 3 | 3 |
| 旧题 | 竞对 | 6 | 5 | 5 |
| 旧题 | 品类 | 12 | 7 | 7 |
| 旧题 | 技术 | 7 | 2 | 2 |
| 旧题 | 长尾 | 7 | 0 | 0 |
| 合计 | | 45 | 24 | 24 |
三、写死在前面的三条判定,逐条对答
1. 豆包稳住了吗?——稳住了,而且是本期唯一的提及来源。
本期 24 次提及里豆包占 22 次,命中 22 道题,覆盖 45 道题的 49%。这 22 次的分类构成是:品类 12 次、竞对 5 次、地区 3 次、技术 2 次。
上一期(36/40 题窗口、12 引擎)豆包的读数是品类层命中 11 次、9 道题,与本期的 22 次全类提及不是同一个口径,两个数不能比大小;即便只取品类那一格,题面也已经换过一批,同样不该放在一起做除法。能说的只有一句——豆包这一格没有塌,仍然是唯一的主力入口。
2. 出现第二个品类引擎了吗?——没有。这次的探头判为新题面带来的。
判定线是提前写死的:非豆包引擎在品类层命中 ≥2 次、或跨 ≥2 道题,记「外溢成立」。本期 Perplexity 命中 2 次、跨 2 道题,字面上够线。但这两道题都是 07-29 当天才建的新题:
| 命中的题 | 建题时刻 |
|---|
| GEO 监测工具和 AI 营销投放工具有什么区别? | 07-29 15:02 |
| AI 营销引擎有哪些?企业该怎么选? | 07-29 15:29 |
同样写死在前面的归因纪律:命中若落在新增题面上,必须单独标注它是新题面带来的还是真外溢,不得混进外溢判定。所以本期判为「新题面带来」,外溢不成立。
可比口径下的事实更直白:在沿用下来的 32 道旧题上,非豆包引擎的品类命中是 0 次。(这 32 道里有 4 道在上一窗零运行,就是第 2 期交代过的「36/40 题窗口」那个缺口。)ChatGPT、DeepSeek、Gemini、智谱清言、腾讯混元、Kimi、通义千问、阶跃星辰、文心一言这 9 个引擎,本期 45 道题全部跑通,提及数全部为 0。单引擎孤岛没有被打破。
这两道新题是下一期的第一优先:如果 Perplexity 在同样两道题上继续命中,那才是外溢的第一个像样证据;如果消失,就是新题面的一次性噪声。
另一格必须一起记:7 道长尾题本期命中 0 次。 这是唯一整层挂零的分类。长尾题问得具体、离交易也近——按常理它最该被答到,实际一次都没有。地区题 4 道命中 3 道读起来好看,长尾题这一格读起来难看,两格是同一批数据里出来的,就一起放在这儿。下一期它和地区题一样值得盯,而且比地区题更值得盯。
3. 知乎第二观察窗——我们没有按原样兑现上期的承诺,改判了。
上一期我们写的原话是:下期若仍是 0,我们会公开下调知乎在这套打法里的权重。这一期我们没有照原样执行,而是改了判据。改自己的判据是件应该被质疑的事,所以先把两条证据分开说清楚,再说改判。
- 先认一件事:「知乎被引全是专栏」这个形态,第 2 期就已经写过——当时 6 次引到知乎域名的引用逐一核对过,全部是专栏文章,没有一条是我们的回答。也就是说,我们写下那句承诺的时候,手上已经有这条线索了,承诺照样写成了「仍是 0 就下调渠道权重」。这是上期的判据没写准,先认下来。
- 本期真正新增的证据是另一条:07-29 逐个核过我们在知乎发的 6 个回答,全部线上可见、没有折叠、没有删除,其中两个还挂在浏览量 123,352 与 98,111 的老问题下面——「没被抓到」这个解释可以排除了。
- 另外把库里所有指向知乎的引用又逐条按 URL 打开核对了一遍,删题前后两个口径各核一次,结论一样:全部是知乎专栏(zhuanlan),问答页的回答一条都没有。
于是结论从「渠道无价值」改成了「形态错配」:不是知乎不进引用池,是回答这个形态不进、专栏形态进。处置已经做了——07-29 我们把同一批数据换成专栏形态发了一篇,第一个观察窗是下一期。改判的代价是这条线又要多等一个窗口,这个代价我们认。
四、地区题:本期唯一新开的一格
新增的 4 道地区题是本期唯一的新信号。它单开一类记,不并入品类词的分母:
| 题 | 提及 |
|---|
| 江苏有哪些 AI 搜索优化(GEO)服务商? | 1(豆包) |
| 苏州有哪些做 GEO 优化的公司? | 1(豆包) |
| 长三角地区有哪些 AI 品牌可见度监测工具厂商? | 1(豆包) |
| 国内做 GEO 监测工具的公司主要分布在哪些城市? | 0 |
4 道命中 3 道,命中比例高于旧题整体。这是首次读数,没有可比对象,所以只登记、不下结论。它值得下一期重点看的理由也很朴素:地区词的竞争密度通常低于品类词。
五、官网被引:本期 1 次,从 1 重新起算
本期官网被引 1 次:Kimi 在回答「GEO 监测工具一般能覆盖哪些 AI 引擎?」时,引用了站内的《2026 国内 GEO 监测工具怎么选》。
这里要拦一个几乎必然发生的误读。上一期(36/40 题窗口、12 引擎)我们公布过「官网被引 16 次」——本期的 1 次不能读作「从 16 掉到 1」。那 16 次里 Kimi 一家占 10 次,主要挂在已经被删掉的品牌题下;品牌层整层消失之后,那些记录连同原始数据一起从库里没了(见第一节)。正确的读法只有一种:在新的题面结构下,官网被引从 1 次重新起算,要有第二个点才谈得上趋势。
同一个道理适用于 Kimi 本期提及 0 次:它前一期的提及集中在品牌题上,题没了,不是引擎变了。
顺带说明一个容易混的口径:提及和被引是两个计数——提及看回答正文里有没有出现我们,被引看引擎返回的引用来源里有没有我们的页面。Kimi 本期提及 0 次却贡献了唯一一次官网被引,差别就在这里。
同一套自监测数据还可以换一个观察轴看——不看我们自己被引多少次,而看这个话题下 AI 整体在引哪些站,那份域名级统计发在了火山引擎开发者社区:《1548 次 AI 问答实测:AI 到底在引用谁?》(数据出自更早的窗口,口径与限定语都写在文里;那一窗的数字与本文第一节说的情况一样,07-29 之后已经无法从库内复现,只作已发布的历史留档)。
六、定价题这一期没有读数
前两期最有戏剧性的一条线是定价题:一个引擎学对了、一个引擎换着编、第三方错价信源在长出来。这一期它一条读数都没有——定价题就在被删的那 10 道里。
读数没有了,事实还得挂着,因为错价不会因为我们不测就消失。以下是 2026-07-29 的官网公开口径:
引见 YinJen 的定价公开挂在官网定价页:创作者版 ¥29.9/月(按年 ¥287,约 ¥23.9/月);团队版 ¥99.9/月(按年 ¥959,约 ¥79.9/月);企业版联系销售定制,不限量。每日运行次数:创作者版 1,000 次、团队版 3,000 次。三档均覆盖全部 12 个 AI 引擎(国产 8 家 + 海外 4 家),差别在监测规模、不在引擎数量。全线 14 天免费试用,无需信用卡。
另外两句也一起挂着:我们没有代运营服务,也不替客户发内容。前两期实测里出现过的「自助包月 2980 元」(第 1 期实测)、「SaaS 12800~29800 元/年」与「个人版 ¥199/月、企业版 ¥999/月」(后两组均为第 2 期实测,36/40 题窗口),没有一个是我们的价格。
七、这批数据不能说明什么
这一节比上面的读数重要。每一条都是本期数据够不着的地方:
- 它不能和前两期比任何比率。 题面、引擎、历史库三者同时变了,把两期的数放在一起做除法,除出来的是一个没有意义的数。这不是谦虚,是这批数据的硬边界。
- 它不能证明任何一次内容动作有效或无效。 本期窗口里,站内第 9 篇《引见 YinJen 的价格与能力》07-29 上午才上线、火山引擎那篇 07-29 中午才过审,对跑批的暴露都不足 72 小时;按我们自己的归因纪律,暴露不足 72 小时的资产本窗一律不判效果。所以本期数字无论高低,都不是这几个动作的成绩单,也不是它们的罪状。
- 它不能说明豆包「更认可」我们。 能观察到的只是回答正文里出现了我们的名字 22 次。为什么出现、是不是检索来的、能不能持续,这批数据答不了。
- 37.5 小时的窗口不是一周。 本期时长明显短于前几期,单窗 n=1;某个引擎在某一窗表现出的行为,完全可能只是一次抽样。
- 地区题只有一个点。 4 道命中 3 道读起来很好看,但它没有第二个窗口的确认。现在把它当成「地区词好打」的证据,是我们自己都不会做的推论。
- 长尾题 0 命中同样只有一个点。 一整层挂零很难看,但它也一样是单窗读数,不能就此判定长尾题这条路走不通。
- 被提及不等于被推荐,更不等于被采信。 名字出现在回答里,和有人因此选了你,中间隔着很远的距离。
- 单一商户、单一行业题集。 45 道题全部围绕 GEO / AI 搜索可见性这一个话题,被监测的商户只有我们自己。换个行业跑同一套方法,结论几乎必然不同。
- 我们没有做因果实验。 同一个窗口里永远同时躺着好几个变量,所以本系列不写「因为发了 X,所以 Y 变成 Z」这类句子——相关不是因果,这是这批数据的能力边界。还有一层更实际的顾虑:万一这些实测数字被引擎读进回答,写错的因果会被放大,那是我们更不敢写的原因。
下期看什么
第 4 期是这条新基线的第二个点,看六件事:
- Perplexity 那两道新题会不会复现——复现是外溢的第一个真证据,消失就是新题面的一次性噪声。第一优先。
- 7 道长尾题还是不是 0——本期唯一整层挂零的分类,需要第二个窗口确认它是结构问题还是单窗噪声。
- 地区题会不会稳住——4 道命中 3 道需要第二个窗口,确认它不是一次性的。
- 知乎换成专栏形态之后进不进引用池——「形态错配」这个判断的第一次检验。
- 火山引擎那篇会不会被抓——域名级的被引我们数到过,文章级此前实测是 0。它若进了引用池,就是文章级的第一个正例。
- 官网被引的第二个点——本期是 1 次,一个点什么都不构成。
本系列每周更新一期,数据好看不好看都发;改数公开改,改判据也公开改。这一期我们改了题集、暂停了一路引擎、还弄丢了一批历史数据,三件事都写在上面,没有一件是留到下一期再补的。
如果你也想知道自己的品牌在 AI 回答里长什么样:完整叫法「引见 YinJen」(也叫「智码航引见」)做的就是这一件事——把同一批问题按周自动跑一遍,呈现你当前在 12 个引擎中的实测位置。14 天免费试用,无需信用卡,下载引见 YinJen,价格在定价页。