← 返回博客/博客·2026 · 09 · 30·24 min

中国 AI 引擎引用源月榜 · 第 1 期(2026 年 9 月):三轮 13,203 条引用、2,225 个域名,附可复现口径

2026 年 9 月,我们用同一套 45 道中文 GEO 题按周问了三轮 AI 引擎(产品覆盖 12 个 AI 引擎,本期实跑 11 个,其中 9 个进可靠区间),把回答里的引用按域名合并计数:13,203 条引用、2,225 个域名。前 10 个域名合计占 24.9%,前 100 个占 63.8%;1,313 个域名三轮里只出现过 1 次。本文给出总榜前 20、三轮拆开后的波动、五个题层各自的头部、与 8 月 issue-5 的占比对照,以及照着就能复核的口径和脚本。原始数据集 issue-11 公开在 GitHub。单一商户题集的实测,不是行业均值。

引
引见 GEO 团队
生成式引擎优化 · 引见 YinJen

这是《中国 AI 引擎引用源月榜》第 1 期。我们每周拿同一套 45 道中文 GEO 题去问一批 AI 引擎,把回答里给出的引用链接原样存下来。本期把 9 月已经收口的三轮周监测合在一起,按域名数了一遍:13,203 条引用,来自 2,225 个不同域名。

先给四个读数,后面每一节都有出处和算法:

  • 头部并不集中。 引用次数前 10 的域名合计占 24.9%,前 100 合计占 63.8%。前 100 之外还有 2,125 个域名,平均每个只有 2.25 条。
  • 长尾很长,而且每轮换一批。 2,225 个域名里,1,313 个在三轮里只出现过 1 次;三轮都出现的只有 356 个,但它们贡献了 77.5% 的引用。
  • 只看一轮容易看偏。 前 10 里的 zhuanlan.zhihu.com 三轮分别是 61、34、126 次;排在第 25 位的 bilibili.com 是 101、2、2 次。
  • 问法不同,头部不同。 「技术与集成」层居首的是 developer.aliyun.com,「地区相关」层是 cnblogs.com,另外三层是 baijiahao.baidu.com 或 iesdouyin.com。

原始数据集公开在 GitHub 组织 ZhiMaHang 的 chinese-ai-engine-sources 仓,文件是 data/2026-09-18-issue-11.json(下称 issue-11)。本文的数字要么能从这份文件直接算出来,要么在文中注明了来自同一快照的底表。


一、口径:先读这一节,再看数字

项本期取值
数据来源引见 YinJen 的自监测记录(我们拿自家品牌做的 GEO 监测)。这是单一商户题集的实测,不是行业均值
题集45 道中文 GEO 监测题,分五层:核心品类 21、长尾问答 7、技术与集成 7、地区相关 4、竞品对比 6。题面公开在同一仓库的 prompts/zh-geo-45.md,与实际在跑的题逐字一致
引擎产品覆盖 12 个 AI 引擎;本期实跑 11 个,其中 9 个进可靠区间(见下表)
轮次9 月已经收口的三轮周监测,即我们周监测的第 9、10、11 轮。按轮次编号切分,不按日期窗口切分
时间窗(北京时间)第 9 轮 09-01 14:13 ~ 09-05 12:16;第 10 轮 09-09 09:53 ~ 09-14 15:52;第 11 轮 09-17 11:40 ~ 09-18 11:48
不纳入第 12 轮(09-24 起):取数时还有补跑没完成,顺延到第 2 期
计数单位1 条引用 = 回答里给出的 1 个 URL。同一 URL 在不同题、不同引擎、不同轮次里出现,各算 1 次;同一次回答里不重复计
域名取原值,不合并子域:blog.csdn.net、m.blog.csdn.net、csdn.net 各算一条
排序先按次数降序,同票按域名字母序
取数时点北京时间 2026-09-29 16:08 的快照。监测记录会因补跑被原地改写,事后重算可能略有出入
脱敏发布前按固定规则剔除 25 个域名、42 条引用,它们都不在前 100 内。文中总数都是剔除后的口径,见第八节

两套编号别混。 「月榜第 1 期」是本系列文章的期数;「issue-11」是数据集编号,取的是本期所含末轮周监测的轮次号。8 月发布的 issue-5 是第 5 轮的单轮数据,issue-6 到 issue-10 没有单独发布,第 9、10 轮已经并进本期。

引擎覆盖(每轮 45 题,三轮合计每个引擎应跑 135 次;「有效回答」指状态为 ok 的回答)

引擎(数据集里的键)有效回答本期引用判定
文心一言(wenxin)135/1352,652可靠区间
腾讯元宝(hunyuan)134/1352,354可靠区间(第 11 轮失败 1 次)
豆包(doubao)135/1352,016可靠区间
DeepSeek(deepseek)135/1351,816可靠区间
智谱 GLM(glm)135/1351,345可靠区间
阶跃 StepFun(stepfun)135/135996可靠区间
通义千问(qwen)135/135763可靠区间
Perplexity(perplexity)135/135511可靠区间
Gemini(gemini)134/135200可靠区间(第 11 轮失败 1 次)
ChatGPT(chatgpt)92/135284⚠️ 不进可靠区间(第 11 轮只跑成 2/45)
Kimi(kimi)81/135266⚠️ 不进可靠区间(第 10 轮 36/45;第 11 轮登录态失效,0/45)
Claude(claude)0/1350三轮都主动没跑,不计入实跑
  • 可靠区间的判据是我们自己定的:三轮合计有效率不低于 95%,而且没有任何一轮低于 90%。
  • ChatGPT 和 Kimi 的引用照样计入总数和各张榜单,只打标、不剔除。缺口照实写,不补齐、不抹平。
  • 11 个引擎的引用加起来是 13,203,与总数一致(第七节的脚本会核对这一条)。

二、总览:头部占四分之一,长尾占三分之一以上

三轮分别收到 4,555、4,372、4,276 条引用。第 11 轮 ChatGPT 和 Kimi 几乎没跑成,轮与轮之间的总数差异里混着这个因素。

切法域名数引用占总引用
第 1 名(baijiahao.baidu.com)16154.66%
前 10103,28724.9%
前 20205,08438.5%
前 1001008,42163.8%
前 100 之外2,1254,78236.2%
其中三轮只出现过 1 次的1,3131,3139.9%
  • 被引 100 次以上的域名有 25 个;进前 100 的门槛是 17 次(第 100 名 17 次;底表里第 101 名是 16 次,截断处没有同票)。
  • 表中前五行都能从 issue-11 直接算出。表中末行和本节开头的分轮次数来自同一快照的底表,公开 JSON 里没有这几项,我们把它们一并写进了仓库 README 的本期段落。

三、总榜前 20

#域名引用占比
1baijiahao.baidu.com6154.66%
2iesdouyin.com4043.06%
3blog.csdn.net3572.70%
4cnblogs.com3522.67%
5ithome.com3452.61%
6developer.volcengine.com2772.10%
7developer.aliyun.com2662.01%
8sohu.com2301.74%
9zhuanlan.zhihu.com2211.67%
10cloud.tencent.com2201.67%
11jiemian.com2141.62%
12page.sm.cn2061.56%
13mp.weixin.qq.com1971.49%
14baike.baidu.com1921.45%
15m.toutiao.com1921.45%
16github.com1691.28%
17cet.com.cn1671.26%
18ima.qq.com1651.25%
19m.blog.csdn.net1521.15%
20chinadevelopment.com.cn1431.08%

完整的前 100 在 issue-11 的 top_domains 里。读这张表时记住两件事:

  1. 数的是域名,不是文章。 一个域名在表上,只说明引擎在这些题上引用了该域名下的某些页面,不说明其中任何一篇是谁写的。
  2. 次数只是次数。 它不代表站点的内容水平或可信度,我们也不评价表中任何站点。

四、三轮拆开看:前 10 的波动

分轮次数来自同一快照的底表(公开 JSON 只有三轮合计,本表同步写进仓库 README)。

#域名第 9 轮第 10 轮第 11 轮
1baijiahao.baidu.com154253208
2iesdouyin.com20411684
3blog.csdn.net11814792
4cnblogs.com141111100
5ithome.com12012798
6developer.volcengine.com1089574
7developer.aliyun.com9173102
8sohu.com4869113
9zhuanlan.zhihu.com6134126
10cloud.tencent.com816970
  • 三轮各自的前 10 里,三轮都在的只有 6 个:baijiahao.baidu.com、iesdouyin.com、blog.csdn.net、cnblogs.com、ithome.com、developer.aliyun.com。
  • 前 100 里有 99 个三轮都出现过;例外是 quanmin.baidu.com,36 次全在第 9 轮。
  • 放到全部 2,225 个域名上:三轮都出现的 356 个(占域名 16.0%),贡献了 77.5% 的引用;只在一轮出现的 1,461 个(占域名 65.7%)。

怎么读:头部相对稳定,长尾每轮大换血。单轮读数适合看「这一轮发生了什么」,不适合当基线;这也是我们把榜单改成月度三轮合并的原因。另外,第 11 轮 ChatGPT 和 Kimi 的缺口会让这一轮的数整体偏低,某个域名在第 11 轮变多或变少,不能直接读成「变热」或「变冷」。


五、按题层看:问法不同,头部不同

题集的五层对应五种问法。每层前 5 如下(每层完整前 15 在 issue-11 的 top_domains_by_prompt_layer 里):

题层(题数)头部 5 个域名(引用)
核心品类(21)baijiahao.baidu.com 290 · iesdouyin.com 192 · blog.csdn.net 191 · ithome.com 181 · developer.volcengine.com 156
长尾问答(7)baijiahao.baidu.com 120 · cnblogs.com 55 · developer.aliyun.com 54 · sohu.com 53 · blog.csdn.net 52(与第 6 位 cloud.tencent.com 同票)
技术与集成(7)developer.aliyun.com 105 · baijiahao.baidu.com 101 · blog.csdn.net 60 · ima.qq.com 52 · cloud.tencent.com 48
地区相关(4)cnblogs.com 78 · baike.baidu.com 58 · iesdouyin.com 58 · baijiahao.baidu.com 53 · jiemian.com 44
竞品对比(6)iesdouyin.com 128 · ithome.com 95 · geo.newrank.cn 74 · a.newrank.cn 67 · mp.weixin.qq.com 52
  • 五层的前 15 里都有的域名只有 3 个:baijiahao.baidu.com、cnblogs.com、developer.volcengine.com。
  • 各层前 15 里「只在本层出现」的域名数:竞品对比 5 个、地区相关 4 个、技术与集成 2 个、核心品类 1 个(github.com)、长尾问答 0 个。问具体产品、问具体地区的这两层,独有的域名多于其他三层。
  • 各层题数不同(21 题对 4 题),层与层之间只比结构,不比绝对数。
  • 长尾问答、竞品对比、地区相关三层的第 15、16 名同票,按域名字母序截断,这一点也写在 issue-11 的说明字段里。

六、和 8 月的 issue-5 对照:只比占比和位次

issue-5 是 8 月第 5 轮的单轮数据(4,636 条引用)。两期题面完全相同,但一个是单轮、一个是三轮合并,引擎覆盖也不同,所以绝对数不能比,只比占比和位次。

域名9 月位次9 月占比8 月位次8 月占比
baijiahao.baidu.com14.66%43.28%
iesdouyin.com23.06%33.58%
blog.csdn.net32.70%24.38%
cnblogs.com42.67%15.57%
ithome.com52.61%53.04%
developer.volcengine.com62.10%81.92%
developer.aliyun.com72.01%210.93%
sohu.com81.74%230.86%
zhuanlan.zhihu.com91.67%141.32%
cloud.tencent.com101.67%131.36%
  • 两期前 10 有 6 个域名重合,前 100 有 68 个重合。
  • 前 10 合计占比从 30.4% 降到 24.9%。这不能读成「头部变弱」:三轮合并会把只出现一轮的长尾域名累积起来,头部占比本来就会被摊薄;而且两期缺的引擎不同(8 月是 Gemini 只跑了 28/45,9 月是 ChatGPT 和 Kimi 没跑满)。
  • 位次变化同样只是两次观测的差,不构成趋势。至少要再有几期同口径的数,才谈得上方向。

七、怎么复现

下面这段脚本只读 issue-11 一个文件,就能核对总数、算出本文第二、三、五节的数:

import json

d = json.load(open("data/2026-09-18-issue-11.json", encoding="utf-8"))
total = d["_meta"]["citations_total"]                     # 13203
assert sum(d["citations_by_engine"].values()) == total    # ① 各引擎引用之和 = 总数

for n in (1, 10, 20, 100):                                # ② 总榜前 N 的合计与占比
    s = sum(x["citations"] for x in d["top_domains"][:n])
    print(f"前 {n}: {s} 条, {s / total:.2%}")

rest_domains = d["_meta"]["unique_domains"] - 100         # ③ 前 100 之外的域名数与引用数
rest_cites = total - sum(x["citations"] for x in d["top_domains"])
print(rest_domains, rest_cites, round(rest_cites / rest_domains, 2))

pos = {x["domain"]: (i + 1, x["citations"]) for i, x in enumerate(d["top_domains"])}
print(pos.get("zhuanlan.zhihu.com"))                      # ④ 某个域名的位次与次数

print(d["top_domains_by_prompt_layer"]["tech"][:5])       # ⑤ 某一题层的头部

和 issue-5 对照时,把同样的算法用在 data/2026-08-05-issue-5.json 上即可。

数据是怎么取出来的:引用取自每一次有效回答保存下来的引用列表;过滤条件是「本题集、未删除、状态为 ok、轮次编号属于上面三轮」;按域名原值分组计数,再按第八节的规则剔除。数据库行会被补跑原地改写,如果重算对不上,先对取数时点,再对口径。


八、脱敏:发布前做了什么

公开数据集之前,我们按四条固定规则做了脱敏,原文如下:

本期(issue-11,2026-09 月度合并)发布前按四条固定规则做了脱敏: ① 剔除可能指向第三方(我们服务的商户)的品牌域名和行业域名; ② 核验每个公开数字都只来自本题集的监测记录,不含任何其他商户的数据; ③ 只发布域名层级的聚合(总榜、分引擎总数、题集分层榜),不发布单题或关键词级的切片; ④ 留存逐条自查记录。 本期共剔除 25 个域名、42 条引用,全部排在 Top 100 之外。公开的总数都是剔除后的口径。

被剔除的是哪些域名,我们不公开:列出来本身就会指向第三方。能公开的是影响范围:剔除前后,前 100 和五个题层的前 15 一条都没有变。


九、这份榜对做 GEO 有什么用

能用来做的:

  1. 看这个品类的题,引擎常去哪些站点取材。 规划内容往哪里发时,这是一张参考面,但只是参考面。
  2. 按题层看,而不是只看总榜。 用户问「怎么接入」和问「某地有没有」,引擎引用的来源差别很大。
  3. 看持续性。 三轮都出现的域名,比只在某一轮冒出来的域名更值得纳入观察名单。

不能用来做的:

  1. 本文不构成对任何收录或排名的承诺。 表里的次数是过去三轮的观测,不预示任何站点、任何内容以后会不会被引用。
  2. 不能外推到别的品类。 题集只围绕 GEO 这一个品类,换品类结论多半不同。
  3. 不能拿域名当自己的资产。 某个平台在榜上,不等于你在这个平台上的文章被引用了。判断自己的内容有没有被引,必须落到 URL 级精确匹配;仓库里的 scripts/domain_vs_article.py 就是为这件事写的。
  4. 不能拿次数判断好坏。 次数只说明出现得多,不说明内容更好。

十、下一期

第 2 期从第 12 轮开始收。规则写死:每期收「上一期之后、取数时已经收口」的全部周监测轮次,逐个列出轮次;取数时还没收口的不收,顺延到下一期。仓库从本期起按月更新。


出处与口径:全部数字来自引见 YinJen 自监测的第 9、10、11 轮周监测(北京时间 2026-09-01 ~ 09-18),北京时间 2026-09-29 16:08 取数;45 道中文 GEO 题,产品覆盖 12 个 AI 引擎,本期实跑 11 个,其中 9 个进可靠区间;单一商户题集的实测,不是行业均值。数据集与题集见 GitHub:ZhiMaHang/chinese-ai-engine-sources(issue-11)。

本文由苏州智码航科技有限公司(引见 YinJen 团队)撰写。本文所有数据的原始数据集公开在 GitHub 组织 ZhiMaHang(已验证域名归属 zhimahang.com)。官网:zhimahang.com

本文数据来自作者所属公司自建 GEO 监测工具的生产环境实测,文字由 AI 辅助创作、作者审校发布。


延伸阅读

引
关于作者
引见 GEO 团队

引见(YinJen)的生成式引擎优化(GEO)研究与实战团队,长期监测内容在 ChatGPT、Claude、Gemini、Perplexity、豆包、DeepSeek 等主流 AI 引擎中的引用与可见度。本系列均为一手实操记录。

了解引见如何帮你做 GEO →