库
采集器
29 个预置采集器,按采集来源分类。填一张表单,选好请求要走的代理,采到的行就会落进一张单独的表——全程没有任何浏览器窗口。
什么是采集器
采集器只干一件事,约定也极短:给参数,出一张表,完全不开浏览器。 你把它对准某样公开的东西——一次搜索、一个账号、一个地点——采回来的行就是全部交付物。
这正是它和自动化流程的区别:后者在你的某个环境里驱动一个真实的浏览器窗口,什么都能做。操作你自己的账号的流程是自动化;对准别人公开页面的采集,是采集器。它走的是普通 HTTP,带着真实浏览器的 TLS 指纹——所以一次 Google Maps 搜索,过去在窗口里要八分钟,现在不开窗口只要六秒左右。
采集器不占用你套餐里的任何一个自动化名额,从不打开浏览器窗口,除了 2 个之外都在未登录状态下采集。例外都列在下面,接不接由你决定,而且采集器写下的每一行都会记下它是以哪种方式采到的。
全部 29 个采集器
一张卡片对应一件事,而不是对应一个服务——一个服务通常有好几张,因为它的主页、它的帖子和关注它的人是三种不同的集合,对应三张不同的表单。下面的一切都读自应用自己的目录,所以这份清单就是实际交付的内容,而不是对它的描述。每个名字都通向那张卡片自己的页面:它真实的表单,以及它写出的表所包含的每一列。
| 采集器 | 你要提供 | 列数 | 账号 | 代理 |
|---|---|---|---|---|
| Google Keyword Ideas | Seeds | 7 | 不需要 | 可选 |
| YouTube Keyword Ideas | Seeds | 7 | 不需要 | 可选 |
| Bing Keyword Ideas | Seeds | 6 | 不需要 | 可选 |
| Amazon Keyword Ideas | Seeds | 6 | 不需要 | 可选 |
| Google Trending Now | Countries | 11 | 不需要 | 可选 |
| YouTube Search Results | Keywords | 14 | 不需要 | 可选 |
| Google Search Results | Keywords | 9 | 不需要 | 可选 |
| Google Trends | Keywords | 7 | 不需要 | 可选 |
| YouTube Transcripts | Videos | 10 | 不需要 | 可选 |
| Google Maps | What to find | 47 | 不需要 | 可选 |
| Instagram Profiles | Accounts | 34 | 你的账号,一次 | 建议使用 |
| Instagram Posts | Accounts | 27 | 不需要 | 建议使用 |
| Instagram Followers | Accounts | 13 | 你的账号,一次 | 建议使用 |
| LinkedIn Profiles | Profiles | 21 | 不需要 | 可选 |
| LinkedIn Companies | Companies | 29 | 不需要 | 可选 |
| LinkedIn Company Posts | Companies | 11 | 不需要 | 可选 |
| LinkedIn Posts | Posts | 21 | 不需要 | 可选 |
| LinkedIn Post Comments | Posts | 10 | 不需要 | 可选 |
| TikTok Profiles | Accounts | 24 | 不需要 | 建议使用 |
| TikTok Profile Videos | Accounts | 15 | 不需要 | 建议使用 |
| TikTok Videos | Video URLs | 39 | 不需要 | 建议使用 |
| X Profiles | Accounts | 24 | 不需要 | 可选 |
| X Posts | Accounts | 27 | 不需要 | 建议使用 |
| X Post Lookup | Posts | 19 | 不需要 | 可选 |
| Shopify Storefronts | Stores | 22 | 不需要 | 可选 |
| Indeed Jobs | Searches | 27 | 不需要 | 建议使用 |
| Greenhouse Job Boards | Boards | 16 | 不需要 | 可选 |
| Ashby Job Boards | Boards | 21 | 不需要 | 可选 |
| Lever Job Boards | Boards | 15 | 不需要 | 可选 |
搜索与 SEO
人们正在搜索框里输入什么,今天什么在涨,以及已经排在这些词前面的是谁。
Google 用来补全你那个种子词的每一条短语——按字母、按疑问词、按带购买意向的词逐一展开,并保持 Google 自己的排序。一个词就能拿到几百条真实搜索,不需要账号,也不开浏览器。
- 你要提供
- Seeds
- 你会拿到
- 7 列,来自 10 项设置
- 浏览器
- 不需要
YouTube 用来补全你那个种子词的内容。同样的词,它给出的列表和 Google 不一样:人们来 YouTube 是想看怎么做,而不是想买。一个频道该做的标题和选题,按 YouTube 自己的排序给出。
- 你要提供
- Seeds
- 你会拿到
- 7 列,来自 10 项设置
- 浏览器
- 不需要
同样的展开,跑在 Bing 的自动补全上——DuckDuckGo 用的也是它。给种子词一份便宜的第二意见:两个引擎都提示的短语,是人们真的会输入的;只有 Bing 有的那条,往往是一个值得拿下的空档。
- 你要提供
- Seeds
- 你会拿到
- 6 列,来自 9 项设置
- 浏览器
- 不需要
买家在 Amazon 里围绕你的种子词输入的内容。所有关键词来源里购买意向最强的一种——这里的每一次搜索背后都是一个正准备花钱的人——而且措辞是商品式的,不是提问式的。
- 你要提供
- Seeds
- 你会拿到
- 6 列,来自 9 项设置
- 浏览器
- 不需要
一个国家今天在搜、昨天还没在搜的东西——附上 Google 自己的粗略搜索量,以及每一条背后的新闻。把它挂到排程上,这张表就成了一份记录:什么时候发生了什么。
- 你要提供
- Countries
- 你会拿到
- 11 列,来自 1 项设置
- 浏览器
- 不需要
某个关键词下排在前面的视频,带播放量、频道、时长和发布时间。把 Keyword Ideas 卡片找到的词喂进来,这张表就能回答那些卡片回答不了的问题:已经有人在做了吗,做得怎么样。
- 你要提供
- Keywords
- 你会拿到
- 14 列,来自 6 项设置
- 浏览器
- 不需要
某个关键词下排名的页面,按顺序,带标题和摘要。任何排名监测工具的底层其实都是它——把 Keyword Ideas 卡片找到的词交给它,每个词的竞争对手就都在表里了。
- 你要提供
- Keywords
- 你会拿到
- 9 列,来自 4 项设置
- 浏览器
- 不需要
围绕一个关键词正在上升的查询,附 Trends 自己的热度分值。这里唯一一张给出实测需求、而不是提示顺序的卡片——用它把正在增长的词和只是热门的词分开。
- 你要提供
- Keywords
- 你会拿到
- 7 列,来自 4 项设置
- 浏览器
- 不需要
视频里说过的每一句话,带时间戳,每条字幕一行。把它对准已经排在你关键词前面的那些视频,这张表就是它们讲了什么——也是写一份讲得更好的脚本的原料。
- 你要提供
- Videos
- 你会拿到
- 10 列,来自 2 项设置
- 浏览器
- 不需要
地点
商家和地址,来自收录它们的地图与名录。
地图搜索返回的每一个地点,落成表里的一行行,全程不开浏览器窗口:名称、类目、完整邮寄地址、电话、网站、评分、评论数,以及——你要的话——从商家自己网站上取到的邮箱地址。
- 你要提供
- What to find
- 你会拿到
- 47 列,来自 13 项设置
- 浏览器
- 不需要
社交
公开主页、它们发布过的内容,以及关注它们的人。
任何公开账号背后的完整资料头:简介、粉丝数和帖子数、认证状态、商业类目和简介里的那条链接——以及,你要的话,那条链接指向的网站上的邮箱地址。
- 你要提供
- Accounts
- 你会拿到
- 34 列,来自 2 项设置
- 浏览器
- 一次,用来登录
Instagram Posts
建议挂代理一个公开账号发过的全部内容——帖子、轮播和 reels——带文案、时间、点赞、评论、播放量和媒体链接,从新到旧排列,每条一行。
- 你要提供
- Accounts
- 你会拿到
- 27 列,来自 4 项设置
- 浏览器
- 不需要
谁关注了这个账号,或者它回关了谁:每一个都带用户名、姓名、认证状态和 Instagram 自己的 id,每个账号一行,可以直接和一张主页表拼接。
- 你要提供
- Accounts
- 你会拿到
- 13 列,来自 3 项设置
- 浏览器
- 一次,用来登录
任何一个公开主页地址背后的那个人:姓名、简介、城市、现任雇主、就读院校和粉丝数,每人一行,全部读自 LinkedIn 对未登录访客给出的那张页面。
- 你要提供
- Profiles
- 你会拿到
- 21 列,来自 5 项设置
- 浏览器
- 不需要
任何一个公开的 LinkedIn 公司主页背后的那家机构:名称、简介、标语、实时员工数、网站和注册城市,每家一行,读自 LinkedIn 对未登录访客给出的那张页面。
- 你要提供
- Companies
- 你会拿到
- 29 列,来自 6 项设置
- 浏览器
- 不需要
任何一个公开的 LinkedIn 公司主页上的近期帖子:正文全文、标题、发布时间和帖子自己的地址,每条一行。LinkedIn 只给未登录访客嵌入其中七到十条,其余的挡在墙后,这张卡片采到的就是这些。
- 你要提供
- Companies
- 你会拿到
- 11 列,来自 4 项设置
- 浏览器
- 不需要
任何一个公开的 LinkedIn 帖子地址背后的那条内容:正文全文、作者、时间、互动总数、评论数和随附媒体,每条一行,读自 LinkedIn 对未登录访客给出的那张页面。
- 你要提供
- Posts
- 你会拿到
- 21 列,来自 6 项设置
- 浏览器
- 不需要
在某条 LinkedIn 帖子下公开留言的人:姓名、留言内容、时间,以及收到多少个赞,每条评论一行。LinkedIn 只给未登录访客看前八到十条,其余挡住,而且从不显示那些只点了互动的人。
- 你要提供
- Posts
- 你会拿到
- 10 列,来自 6 项设置
- 浏览器
- 不需要
TikTok Profiles
建议挂代理任何一个公开 TikTok @用户名背后的账号:姓名、简介、简介里的链接、粉丝数、获赞数和视频数,每个账号一行,读自 TikTok 对未登录访客给出的那张页面。
- 你要提供
- Accounts
- 你会拿到
- 24 列,来自 6 项设置
- 浏览器
- 不需要
任何一个公开 TikTok 账号最近的十条视频:文案、播放量、封面和视频自己的地址,每条一行。十条是 TikTok 对未登录访客设的上限,不是这张卡片的上限。
- 你要提供
- Accounts
- 你会拿到
- 15 列,来自 4 项设置
- 浏览器
- 不需要
TikTok Videos
建议挂代理你有地址的那条视频,TikTok 公开的一切:播放、点赞、评论、分享、收藏和转发,文案连同其中的话题标签,配乐,作者和作者的各项计数,每条视频一行。
- 你要提供
- Video URLs
- 你会拿到
- 39 列,来自 6 项设置
- 浏览器
- 不需要
一个用户名背后的账号:简介、粉丝数和关注数、发帖数、网站、所在地、注册日期和 X 自己的 id,每个账号一行,可以直接和一张帖子表拼接。
- 你要提供
- Accounts
- 你会拿到
- 24 列,来自 1 项设置
- 浏览器
- 不需要
X Posts
建议挂代理一个账号发过的全部内容:正文、时间、点赞、转发、回复、引用、书签、话题标签、提及,以及 t.co 短链背后的真实链接,每条帖子一行。
- 你要提供
- Accounts
- 你会拿到
- 27 列,来自 6 项设置
- 浏览器
- 不需要
按链接或 id 读取指定的帖子:正文、作者、点赞,以及底下的讨论串长到了什么程度。每条一次请求,也是整个目录里唯一一张任何凭据都不需要的卡片。
- 你要提供
- Posts
- 你会拿到
- 19 列,来自 1 项设置
- 浏览器
- 不需要
电商
各大平台上的商品、价格和卖家。
一家 Shopify 店铺公开的每一件商品:标题、价格、划线价、库存、SKU、供货商、类型、标签和图片,每件一行,直接取自店面自己的目录文件,不需要账号,也不开浏览器。
- 你要提供
- Stores
- 你会拿到
- 22 列,来自 7 项设置
- 浏览器
- 不需要
招聘
一家公司正在招的岗位,来自发布它们的招聘网站和招聘系统。
Indeed Jobs
建议挂代理在 Indeed 上针对某个搜索投放的每一家雇主:岗位、公司、公司的评分和评价数、地点、薪资区间、工作类型和发布多久了,每个职位一行,不需要账号,也不开浏览器。
- 你要提供
- Searches
- 你会拿到
- 27 列,来自 10 项设置
- 浏览器
- 不需要
一家公司在 Greenhouse 上公开的每一个在招岗位:标题、地点、部门、办公地、发布时间和最后一次变动的时间,每个职位一行,取自招聘板自己的公开 API,不需要账号,也不开浏览器。
- 你要提供
- Boards
- 你会拿到
- 16 列,来自 5 项设置
- 浏览器
- 不需要
一家公司在 Ashby 上公开的每一个在招岗位:标题、团队、地点、办公形式、公开的薪资区间和上架时间,每个职位一行,取自招聘板自己的公开 API,不需要账号,也不开浏览器。
- 你要提供
- Boards
- 你会拿到
- 21 列,来自 6 项设置
- 浏览器
- 不需要
一家公司在 Lever 上公开的每一个在招岗位:标题、部门、团队、地点、办公形式和用工形式,每个职位一行,取自招聘板自己的公开 API,不需要账号,也不开浏览器。
- 你要提供
- Boards
- 你会拿到
- 15 列,来自 5 项设置
- 浏览器
- 不需要
怎么跑一个
打开「采集器」标签页,挑一张卡片,填好表单,按「开始」。从这里发起的每一次运行都会生成一张新表,以你搜索的内容和时间命名,收在以该采集器命名的文件夹里——所以同一张卡片跑两次绝不会互相覆盖。想先试试也可以:它只采一页,什么都不写,并告诉你哪些列拿回了内容。
你也可以完全不打开应用就跑一个。助手手里有整个目录,所以「把鹿特丹的牙医采下来」是一句话,而不是一张表单;同样这批工具也在给外部 Agent 用的 MCP 服务器上;而一个 Run scraper 步骤能把采集器放进工作流里。这个步骤是唯一能推翻上面「一次运行一张表」规则的调用方:不管它,它就和别的一样新建一张表;但如果指定一张你命名的表,它会在表不存在时按上面的列建好,之后每次运行都写进这张表——追加,或者按你指定的匹配列就地更新。这样一来,排程上的采集是把一张表养大,而不是每晚留下一张。无论哪种方式,这个步骤都会把表名、表 id 和行数交给下一步。
它们不做什么
这里几乎没有什么需要登录。未登录读取公开页面是已成定论的做法——Bright Data 未登录采集 Meta 并且胜诉,hiQ 登录后采集 LinkedIn 则败诉——所以一张需要账号的卡片,是把一个已定论的问题重新变成开放问题。每一张这样的卡片都是单独作出的决定,而不是默认行为。LinkedIn 在这里完全以未登录方式读取,正是出于这个原因。
有 2 张卡片要账号,而且只出现在网站根本没留下任何未登录来源的地方——不是那种登录之后只是能拿到更多的地方:
- Instagram Profiles — 对于未登录的请求,Instagram 已经不再返回主页简介、粉丝数和简介链接,只给一个空壳。这张卡片需要一个自己的账号才能读到它们。Argus 里其余的一切仍然在未登录状态下采集。
- Instagram Followers — 粉丝列表是 Instagram 唯一只回应已登录请求的东西:未登录时,任何提供它的接口都返回 401「login required」,从哪个地址去问都一样。这张卡片需要一个自己的账号才能读到,用一个随时可弃的小号最合适。Argus 里其余的一切仍然在未登录状态下采集。
即便如此,采集过程也不会打开任何浏览器窗口。窗口只手动打开一次,让你登录;此后的每一个请求,都和其他卡片一样是普通 HTTP。请用一个随时可弃的小号——自动化采集违反这些网站的条款,承载它的账号可能被封停。
它们都不会去驱动页面。凡是需要真实浏览器的事——背后没有列表接口的网站,或者任何操作你自己账号的事——都归自动化流程管。
这里也没有「帮我把这个网址采下来」。采集器是为某个指定服务写的卡片,是照着那个服务自己的返回内容写出来、也是照着它测出来的。要采一个没有卡片覆盖的网站,请改用自动化流程。