人工生成超级数据收集者
Similarweb如何记录全世界的上网行为。
一家以色列初创公司给出上亿个网站的访客数,却没有在其中任何一个上运行计数器。这不是魔法也不是丑闻,而是一台构建得非常巧妙的机器。本报告把它拆解开来:有哪四个来源流入,如何从三百万个浏览器得出关于上亿个网站的说法,面板从哪里来,谁打造了这家公司,以及最终结果有多准。
别人怎么知道一个陌生网站有多少访客?
每两份路演材料里就有一个Similarweb数字。竞争分析、尽职调查、媒体规划、对冲基金模型:里面某处都有一根柱子,显示作者完全没有访问权限的某个网站的月访问量。而且效果出奇地好。
背后的问题是一个漂亮的技术问题,而且有干净的答案。这个数字不是测量,它是一个 推算。就像选举预测:观察一个样本,去偏,用已知事实校准,然后拉伸到总体。
谁懂选举预测,谁就懂Similarweb。同样是四个工作步骤,同样的误差来源,读结果时同样那类谨慎。唯一区别是样本:不是一千个接电话的人,而是数百万浏览器。
本报告从头过一遍这台机器。先是四个流入,按公司自己的描述。然后是计算路径。然后是面板来源,这有自己相当有趣的故事。之后是公司、数字和准确性。
先说标尺:Similarweb在这个行业不是特例,而是记录最完善的例子。这里写的,大体适用于每个从行为测量得出市场数据的提供商。
什么流进来,以及每个来源有什么用
下表中间一列不是摘要,而是制造商页面表述的翻译 Our Data. 右列解释在计算过程中的角色。重要的是,四个来源做的事并不相同:一个提供真相,一个提供行为,一个提供结构,一个填补空白。
顺序与制造商页面一致。每个来源对单个数字的影响有多大,并未公开。
| 来源 | 自己的描述 | 在计算过程中的角色 |
|---|---|---|
| 网站和App运营商 | 来自数百万网站和App的自有分析软件(例如 Google Analytics)的直接测量数据。 | 校准标尺。 运营商自愿交出真实数字,以换取对比值。只有在这里 Similarweb 才知道真相,也只有据此才能校准模型。 |
| Contributors Network | 由安装在全球数百万设备上的 Similarweb 产品收集的匿名流量数据。 | 样本组。 记录访问了哪些地址的浏览器扩展和App。真正的原材料:只有在这里才会产生跨陌生网站的行为。 |
| 公开数据 | 公开可用的数据(例如 Wikipedia、人口普查数据),经算法采集并建立索引。 | 地图。 爬虫提供结构、分类、搜索结果页、App Store 排名和人口数字。对访客说得很少,但对拿什么来对比他们说得很多。 |
| 合作伙伴关系 | 来自全球合作伙伴的预分析数据,例如 DSP、互联网服务商、测量服务商和经济征信机构。 | 填补空白者。 从自有样本组覆盖不到的来源购入的流动数据:其他年龄组、其他国家、其他设备。2018年后大力扩展。 |
如何从三百万个浏览器变成一亿个网站
这是整件事的核心,而且出人意料地容易理解。四个步骤,每一步都有自己的误差,下一步会部分纠正它。
第二个特性来自步骤 02。由浏览器扩展组成的面板通过桌面浏览器看世界。所有绕过它的东西它都看不好:应用、社交网络中的嵌入视图,以及越来越多由人工智能系统提供、而无需有人访问网站的回答。因此该公司多年来一直在购买合作伙伴数据和整个企业。 面板不是产品,它是必须不断更新的校准基础。
数百万人在参与测量,而这并非他们的目标
现在来说最难的原料。这种规模的面板不是靠人们自愿报名做市场研究产生的。它是因为一个产品有用并且顺便记录而产生的。
这不是 Similarweb 的发明,这是自有电视收视率以来行为测量的基本模式。新的是规模:不是几千个家庭,而是数百万设备,而回报不是现金,而是一个免费工具。
这个面板的来源在十多年里被安全研究人员、大学和一家广告拦截器制造商记录下来。下面的时间线是这些工作的冷静总结。
仅限已发布技术分析的事件。覆盖范围不可累加,它们部分重叠。
| 日期 | 发现 | 覆盖范围 | 谁 |
|---|---|---|---|
| 03/2016 | 42个Chrome扩展包含该库 upalytics 并发送每个访问的地址、每个搜索查询甚至来自内部公司网络的地址到九个域名,全部通过匿名化服务注册。其中包括 similarsites.com。同一库也存在于Similarweb扩展本身。 | 8,0 Mio. | Michael Weissbacher, Northeastern University |
| 01/2017 | Similarweb购买设计扩展 Stylish,用户可用它改变其他网站的外观。从同一版本起,Chrome版开始记录。 | ~2,0 Mio. | 收购,公开 |
| 07/2018 | Stylish 发送每个完整地址连同永久标识符到 api.userstyles.org,双重base64打包。完整地址在实践中也意味着:登录令牌、密码重置链接、搜索结果。Google和Mozilla在两天内将该扩展从商店下架,修订版于8月回归。 | ~2,0 Mio. | Robert Heaton |
| 07/2018 | 一家新成立的特拉华公司的九个工具 Big Star Labs 发送每个访问的页面到自己的服务器。AdGuard发现数据格式类似Stylish的,但明确表示关联未经证实。 | 11,0 Mio. | AdGuard |
| 12/2025 | Similarweb扩展通过后加载的配置文件读取ChatGPT、Claude、Gemini和Perplexity的对话,每个提供商有自己的评估逻辑。该功能随2025年5月的一次更新加入。研究者称这种模式 Prompt Poaching。自2026年1月1日起,Similarweb为此补充了一个明确的同意对话框。 | 100万 | John Tuckner, Secure Annex |
| 02/2026 | Stylish 通过五级混淆传输地址和人工智能对话:地址编码、双重base64、列交换、源码中嵌入密钥的AES-256-CBC,最后再一次base64。 | ~200万 | James Arnott |
| 05/2026 | 对287个扩展的系统扫描,合计3740万用户,约占全球所有Chrome用户的百分之一。Similarweb通过多种途径成为最常见的接收者。报告还将 Big Star Labs (370万用户)归属于该公司。 | 3740万 | Q Continuum |
从2018年起情况发生变化。Google和Mozilla收紧规则,欧洲通用数据保护条例生效,Similarweb明显转型:更多购买的合作伙伴数据,更少依赖商店。在2021年与安全公司Check Point的协议中甚至明确写着,Stylish数据不是交换的一部分。在上市文件中,公司至今仍将依赖Contributory Network列为自身风险因素:平台规则经常变化且执行不一致。
Similarweb如今运营多少个扩展?
最直接的答案是两个:流量扩展和销售扩展,两者都带这个名字。我们在2026年8月7日改为 读取了Chrome网上应用店中的发布者标识,也就是说不是比较产品名称,而是账户。这样又多出两个条目。
Stylish至今仍在发布者账户 similarweb-ltd 下,以两百万用户成为最大项。 Similar Sites 运行在 similargroup, 旧公司名。两者在商店条目中都不带 Similarweb 这个名字。
Chrome Web Store 显示的用户数,于 2026 年 8 月 7 日获取。商店会四舍五入到整齐的档位。
| 扩展 | 商店中的发布者 | 带有该名称? | 用户 |
|---|---|---|---|
| Stylish: Custom themes for any website | similarweb-ltd | 否 | 2.000.000 |
| Similarweb: Website Traffic, AI Traffic & SEO Checker | Similarweb | 是 | 1.000.000 |
| Similar Sites: Discover Related Websites | similargroup | 否 | 300.000 |
| Similarweb Sales Extension | Similarweb | 是 | 20.000 |
| Chrome 合计 | 3.320.000 |
答案就在条款里,而且出奇地公开
对于哪些数据真正在流动的问题,不需要安全研究员。只需阅读正确的文件,而这就是那个小难点: Similarweb的隐私声明明确不适用于浏览器扩展。 它在单独的一句话里这么说。
适用于该扩展的声明位于另一个域名: similarsites.com。那里写得很清楚,谁是责任方以及收集什么。这不是泄露,也不是什么发现,这是安装时同意的文本。
表格中的最后一行在经济上最重要:结果可以转给商业客户。这正是Similarweb销售的产品。
逐字摘自similarsites.com上的隐私声明,于2026年8月7日检索。
| 类别 | 原文表述 |
|---|---|
| 责任方 | “Similarweb Ltd.,根据以色列国法律成立,是责任方” |
| 地址 | “访问或浏览的URL、看到或点击了广告的页面、广告URL” |
| 历史 | “点击流数据、搜索历史以及关于互动的信息” |
| 搜索 | “搜索结果页的数据(搜索词、结果的顺序或排名)” |
| 人工智能输入 | “你在某些人工智能工具中输入或发送的提示、请求、内容和其他输入” |
| 共享 | “我们可以将这些类别‘出售’或‘共享’给商业客户,以便我们的商业客户更好地了解消费者行为” |
从珠宝店到股市:Or Offer
Or Offer,1983年出生,在耶路撒冷附近的Tzur Hadassah长大,是个电脑孩子,父母设计珠宝,并与这份职业的不确定性作斗争。毕业后,情报单位8200想招他当程序员。他拒绝了,去了Oketz,也就是军犬部队,其中还包括加沙地带的一个岗位。关于这段时间,他后来说,这教会了他作为年轻人在有经验的人面前站得住脚。
之后他一边工作一边在IDC Herzliya攻读工商管理,并开设了两家珠宝店,分别在Zichron Ya'akov和Netanya,还有一家网店。连锁店名为 Maya Offer,以他母亲的名字命名。他的父母催他往高科技方向发展。
导火索是一个名字:一位供应商提到了设计师David Yurman,他把宝石与银结合起来。Offer想在网上找到类似产品,却发现没有这样的工具。 Similarweb于2007年作为浏览器扩展诞生,它会为某个网站推荐类似的网站。 因此得名,面板也由此而来:数据收集最初是搜索功能的副产品。
他当时23岁,无偿工作了一年多。2007年一位重要伙伴离开了项目,因为他不相信这个产品。24岁时Offer想过放弃,但还是留下了:“我没什么别的事可做,所以就继续干了。”
2009年Yossi Vardi给了他100万美元,换取大约百分之五的股份。公司靠这笔钱撑了五年,当时有七八个人。 2011年出现了决定一切的转向: 从面向消费者的产品转向面向企业和投资者的分析平台。面向消费者的产品并没有消失,它只是换了角色。从现在起它不再是产品,而是测量点。
Offer是唯一创始人,他认为这是优势:“如果有多个创始人,每个人都需要一个角色来感觉自己重要。正因为我是一个人,这让我省去了很多政治。”
2014年Naspers领投了一轮1800万美元的融资。2021年5月公司在纽约证券交易所上市,估值16亿美元,募集约1.8亿美元。总部至今仍在特拉维夫附近的Givatayim,另外还有纽约和伦敦。
超过40%的增长率出现在上市前后的那些年。自2023年以来,增长稳定在较低的两位数区间。
| 年 | 营收(百万 $) | 增长 |
|---|---|---|
| 2019 | 70,6 | – |
| 2020 | 93,5 | +32,4 % |
| 2021 | 137,7 | +47,3 % |
| 2022 | 193,2 | +40,4 % |
| 2023 | 218,0 | +12,8 % |
| 2024 | 249,9 | +14,6 % |
| 2025 | 282,6 | +13,1 % |
广度是买来的
自家的面板测量浏览器中的网络流量。除此之外的一切,应用数据、广告数据、搜索引擎排名,都是通过收购获得的。十年里有八次有据可查的收购,收购价格几乎从未公布。这份名单读起来就像浏览器面板盲点的地图。
| 年 | 公司 | 由此填补了哪些空白 |
|---|---|---|
| 2014 | TapDog | 早期初创公司,股权和现金 |
| 2015 | Swayy | 内容发现 |
| 2015 | Quettra | 移动分析,也就是浏览器面板的第一个盲点 |
| 2017 | Stylish | 一下子大约两百万个浏览器,也就是纯粹的面板规模 |
| 2021 | Embee Mobile | 移动面板数据 |
| 2022 | Rank Ranger | 搜索引擎排名和接口 |
| 2024 | Admetricks | 广告数据 |
| 2024 | 42matters | 应用数据 |
| 2025 | The Search Monitor | 付费搜索、品牌保护、合作伙伴计划管控 |
原材料变成训练材料
2026年5月13日,董事会启动了寻找新首席执行官的工作。Or Offer将任职到2027年年中,在将近整整二十年之后。“Similarweb是我毕生的事业,”他说,这是“正确的时机”。监事会主席Harel Beit-On称这一成果为“独特的数据资产”。
2026年5月市值约为2.7亿美元,比年初低了约56%,远低于上市时的16亿美元。营收在增长,股价却没有。这就是解读下一步的背景框架。
2026年第一季度,Similarweb签署了一份 七位数的大语言模型训练数据合同 与一家现有大客户。第二个已宣布。连同其他多年期合同,公司称总合同价值为4700万美元。
由此形成了一个引人注目的循环。面板记录人们如何与人工智能系统交谈。对这些数据的分析被卖给这类系统的制造商。而第三种产品则向品牌出售对这些系统如何推荐其产品的观察。同一种原材料,三个市场。
对读者来说,有意思的是这个方向:行为数据正从分析工具变成模型的原材料。Similarweb是这方面一个早期的、有据可查的案例。
误差很大,而且并不总是指向同一个方向
有多个针对真实Analytics访问的独立比较。它们在正负号上相互矛盾,而这正是结果。期望单一误差数字的人误解了这件事:误差取决于网站有多大、是什么类型的网站以及Analytics本身在该网站上的测量有多好。
全部以Google Analytics为参考。不同的样本,不同的年份,不同的正负号。
| 研究 | 样本 | 发现 |
|---|---|---|
| Omniconvert, 2026 | 1.787家商店 | 会话大约 高出94%. 误差是系统性的,不是随机的。大网站明显比小网站更准确。 |
| PLOS One, 2022 | 86个网站 | 访问 低19,4%, 独立访客低38,7%,跳出率高25,2%。 |
| SparkToro | 供应商比较 | 对于有5.000名以上用户的网站 最常在±30%以内 从而优于所有竞争对手。在5.000名用户以下则更差。 |
四句话,好让画面正确
第一:这里没有指责任何人。 没有任何案例能向某个机构证明存在违法行为。本报告描述的是一种机制,它并不提出控告。
第二:Similarweb 反驳了 2016 年的说法。 该公司解释说,这是“来自 2016 年的重复外国报道,当时就已经毫无根据,并且在多年前已被驳斥”。这句话在此按原样呈现。
第三:该公司明显进行了改造。 2018 年后摆脱对 Store 的依赖,转向购买的合作伙伴数据,在 Check-Point 协议中明确排除 Stylish 数据,并自 2026 年 1 月起为人工智能内容设置同意对话框。
第四:这是一种行业模式,不是个案。 来自消费产品的行为面板自电视收视率时代就有了。2026 年的扫描发现了 287 个扩展,而不是四个。Similarweb 在此是记录最完善的例子,因为它是上市公司,因此必须承担责任。
而整件事消解的那一点是: 没有一种方法可以在不在某处观察某人的情况下估算他人的流量。 面板的替代方案不是更好的面板,而是根本没有数字。谁使用这个数字,谁就一并使用了这个方法。
对你的分析
用 Similarweb 看比例和走势,不要用在有利害关系的计算里的绝对数字。有记录的误差从一半到两倍不等,并会根据页面类型翻转正负号。
对小网站要加倍小心
大约在每月 5.000 用户以下就会变得不可靠,而且是出于结构性原因:那里校准点太少,面板命中也太少。
对你自己的网站
你的数字已经在面板里了,你的竞争对手可以读到它们。这不是攻击,而是常态。据此规划。
对你的工作设备
浏览器扩展能看到标签页里发生的一切。在一台浏览器里有客户数据、合同或人工智能对话的电脑上,每一个已安装的扩展都是关于保密性的决定。数一遍并检查每一个的发布者,这只是十分钟的事。
- Or Offer,详细的人物专访(Calcalist/CTech)。 童年,Oketz,那条项链,David-Yurman时刻,没有薪水的那些年,Vardis的百万,2011年的转向。第07节几乎所有引语的来源。 calcalistech.com
- Or Offer与Forbes的对话,2017年2月。 创业,危机,为什么转向“像一场离婚”。 forbes.com
- Or Offer谈他的退出,2026年5月(CTech)。 “Similarweb是我毕生的事业”,加上当前的业务数据和股价下跌。 calcalistech.com
- 关于继任的原始声明,2026年5月13日。 Or Offer和监事会主席Harel Beit-On的原文。 ir.similarweb.com
- Marta Sulkiewicz,VP Emerging Solutions,谈人工智能业务(MediaPost,2026年5月)。 关于训练数据合同,以及品牌如今在问的问题:“我们每天都被问到,能否在人工智能代理和机器人中看到成交。” mediapost.com
- Michael Weissbacher,Northeastern University,关于2016年的调查。 从安全研究视角对面板的首次描述。 mweissbacher.com
- John Tuckner,Secure Annex,谈 Prompt Poaching. “Prompt Poaching已经到来,要攫取你最敏感的对话,而浏览器扩展是通往那里的路径。” secureannex.com
- 带有Or Offer原声的季度报告。 电话会议的所有文字记录和录音。 ir.similarweb.com
本报告所依据的一切
十四个来源,每个都有它贡献的内容以及完整地址。它们被故意设得很大并展开:不需要的人可以滚过去,想核实的人不必去找。
- Similarweb: Our Data制造商原文中的四个数据源,以及规模数据:超过100 Mio.个网站,超过4 Mio.个应用,235 Mio.个产品条目,10 Mrd.个信号和每天2 TB,200名数据科学家和50名博士。similarweb.com/corp/ourdata/
- Similarweb: 隐私政策包含关键句子,即本声明明确不适用于应用和浏览器扩展。由此开始追踪到实际适用的声明。similarweb.com/corp/legal/privacy-policy/
- SimilarSites: 隐私政策真正适用于该扩展的声明。将Similarweb Ltd.列为责任方,并列出完整URL、点击流、搜索历史和人工智能输入,以及向企业客户的销售。这是图04的基础。similarsites.com/privacy-policy
- Similarweb: Formular 20-F, 2021财年 (SEC)风险提示,公司自己在其中将Contributory Network对外部商店中扩展和应用的依赖称为业务风险。美国证券交易委员会的服务器拒绝自动抓取,在浏览器中该文档可正常访问。sec.gov/Archives/edgar/data/1842731/000184273122000013/smwb-20211231.htm
- Similarweb Investor Relations: 季度数据2025年营收、客户数量、年营收达100.000美元起的客户、2026年第一季度以及关于训练数据的七位数合同。ir.similarweb.com/financials/quarterly-results
- Michael Weissbacher, Northeastern University: These Chrome extensions spy on 8 million users (2016年3月)首次描述。42个带有upalytics库的扩展,合计8 Mio.次安装,九个接收域名通过匿名化服务注册。整条证据链的起点。mweissbacher.com/2016/03/31/these-chrome-extensions-spy-on-8-million-users/
- Ex-Ray: Detection of History-Leaking Browser Extensions (ACSAC 2017)Northeastern University和University College London的科学后续研究。调查了10.691个扩展,识别出212个会抓取浏览历史的,仅从网络流量模式即可。mweissbacher.com/publications/acsac_exray.pdf
- Robert Heaton: Stylish steals all your internet history (2018年7月2日)导致其从商店下架的技术分析。完整地址连同持久标识发送至api.userstyles.org,经双重base64打包,可通过会话Cookie与账户关联。robertheaton.com/2018/07/02/stylish-browser-extension-steals-your-internet-history/
- AdGuard: Big Star Labs spyware campaign affects over 11.000.000 people (2018年7月)特拉华州一家公司的九个工具、接收域名、作为图片文件的隐私政策。包含明确的保留意见,即与Similarweb的推测关联未经证实。正因如此,这里也将其列为未证实。adguard.com/en/blog/big-star-labs-spyware.html
- John Tuckner, Secure Annex:扩展中 Prompt poaching 猖獗(2025年12月)关于读取人工智能对话的原始分析:按提供商加载带有各自评估逻辑的配置文件,适用于 ChatGPT、Claude、Gemini 和 Perplexity。提出了 Prompt Poaching 这一概念。secureannex.com/blog/prompt-poaching/
- Q Continuum:关于间谍浏览器扩展的报告(2026)迄今最大的系统性扫描:287 个扩展,拥有 37,4 Mio. 用户,930 CPU 天测量时间,公开了方法和单项发现。还将 Big Star Labs 归属于该公司,而 Similarweb 并未证实这一点。github.com/qcontinuum1/spying-extensions
- Consumer Rights Wiki:SimilarWeb 条目直至 2026 年 5 月的完整事件时间线,包括 James Arnott 对五级掩饰的分析,以及将两个扩展均定性为已确认的外泄工具。consumerrights.wiki/w/SimilarWeb
- Globes:Similarweb 通往华尔街的争议之路(2021)最详尽的新闻梳理。包含该公司声明原文,以及与 Check Point 的协议,其中明确排除了 Stylish 数据。en.globes.co.il/en/article-similarwebs-controversial-route-to-wall-street-1001376912
- 准确性研究:Omniconvert(2026)和 PLOS One(2022)来自第 09 节的两项与真实 Analytics 访问的对比。Omniconvert 覆盖 1.787 家商店,PLOS One 覆盖 86 个网站,结论方向相反。两者均已链接,因为正是这一矛盾支撑了论点。omniconvert.com/blog/we-analyzed-1787-ecommerce-websites-similarweb-google-analytics-thats-we-learned/ journals.plos.org/plosone/article?id=10.1371/journal.pone.0268212
McGrinsey 自有工作:图 03 中四个 Chrome 扩展的用户数和发布者账户于 2026 年 8 月 7 日直接从商店条目读取。Chrome Web Store 将用户数取整到整齐档位,因此 3.320.000 的总和相应较粗。第 03 节中的计算路径是根据已公开方法论和面板推算专业文献重建的,该公司并未详细公布。所有翻译均出自我们。凡来源相互矛盾之处,矛盾写在正文中。
本报告拆解了一家公司,因为对它的记录最完整。背后的方法是通用的:理解一个数字,意味着要知道它的样本,以及它是对照什么校准的。
数据 02 转向另一面:当搜索引擎和人工智能回答给出的点击越来越少时,究竟是谁在测量它们?而当越来越少的流量还经过浏览器时,面板会发生什么?
相关: 自己动手做 关于你还用外来部件给自己买了什么的问题。


