采集器

29 个预置采集器,按采集来源分类。填一张表单,选好请求要走的代理,采到的行就会落进一张单独的表——全程没有任何浏览器窗口。

本页内容

什么是采集器

采集器只干一件事,约定也极短:给参数,出一张表,完全不开浏览器。 你把它对准某样公开的东西——一次搜索、一个账号、一个地点——采回来的行就是全部交付物。

这正是它和自动化流程的区别:后者在你的某个环境里驱动一个真实的浏览器窗口,什么都能做。操作你自己的账号的流程是自动化;对准别人公开页面的采集,是采集器。它走的是普通 HTTP,带着真实浏览器的 TLS 指纹——所以一次 Google Maps 搜索,过去在窗口里要八分钟,现在不开窗口只要六秒左右。

采集器不占用你套餐里的任何一个自动化名额,从不打开浏览器窗口,除了 2 个之外都在未登录状态下采集。例外都列在下面,接不接由你决定,而且采集器写下的每一行都会记下它是以哪种方式采到的。

全部 29 个采集器

一张卡片对应一件事,而不是对应一个服务——一个服务通常有好几张,因为它的主页、它的帖子和关注它的人是三种不同的集合,对应三张不同的表单。下面的一切都读自应用自己的目录,所以这份清单就是实际交付的内容,而不是对它的描述。每个名字都通向那张卡片自己的页面:它真实的表单,以及它写出的表所包含的每一列。

采集器你要提供列数账号代理
Google Keyword IdeasSeeds7不需要可选
YouTube Keyword IdeasSeeds7不需要可选
Bing Keyword IdeasSeeds6不需要可选
Amazon Keyword IdeasSeeds6不需要可选
Google Trending NowCountries11不需要可选
YouTube Search ResultsKeywords14不需要可选
Google Search ResultsKeywords9不需要可选
Google TrendsKeywords7不需要可选
YouTube TranscriptsVideos10不需要可选
Google MapsWhat to find47不需要可选
Instagram ProfilesAccounts34你的账号,一次建议使用
Instagram PostsAccounts27不需要建议使用
Instagram FollowersAccounts13你的账号,一次建议使用
LinkedIn ProfilesProfiles21不需要可选
LinkedIn CompaniesCompanies29不需要可选
LinkedIn Company PostsCompanies11不需要可选
LinkedIn PostsPosts21不需要可选
LinkedIn Post CommentsPosts10不需要可选
TikTok ProfilesAccounts24不需要建议使用
TikTok Profile VideosAccounts15不需要建议使用
TikTok VideosVideo URLs39不需要建议使用
X ProfilesAccounts24不需要可选
X PostsAccounts27不需要建议使用
X Post LookupPosts19不需要可选
Shopify StorefrontsStores22不需要可选
Indeed JobsSearches27不需要建议使用
Greenhouse Job BoardsBoards16不需要可选
Ashby Job BoardsBoards21不需要可选
Lever Job BoardsBoards15不需要可选

搜索与 SEO

人们正在搜索框里输入什么,今天什么在涨,以及已经排在这些词前面的是谁。

Google 用来补全你那个种子词的每一条短语——按字母、按疑问词、按带购买意向的词逐一展开,并保持 Google 自己的排序。一个词就能拿到几百条真实搜索,不需要账号,也不开浏览器。

你要提供
Seeds
你会拿到
7 列,来自 10 项设置
浏览器
不需要
它的输入项和全部 7 列 →

YouTube 用来补全你那个种子词的内容。同样的词,它给出的列表和 Google 不一样:人们来 YouTube 是想看怎么做,而不是想买。一个频道该做的标题和选题,按 YouTube 自己的排序给出。

你要提供
Seeds
你会拿到
7 列,来自 10 项设置
浏览器
不需要
它的输入项和全部 7 列 →

同样的展开,跑在 Bing 的自动补全上——DuckDuckGo 用的也是它。给种子词一份便宜的第二意见:两个引擎都提示的短语,是人们真的会输入的;只有 Bing 有的那条,往往是一个值得拿下的空档。

你要提供
Seeds
你会拿到
6 列,来自 9 项设置
浏览器
不需要
它的输入项和全部 6 列 →

买家在 Amazon 里围绕你的种子词输入的内容。所有关键词来源里购买意向最强的一种——这里的每一次搜索背后都是一个正准备花钱的人——而且措辞是商品式的,不是提问式的。

你要提供
Seeds
你会拿到
6 列,来自 9 项设置
浏览器
不需要
它的输入项和全部 6 列 →

一个国家今天在搜、昨天还没在搜的东西——附上 Google 自己的粗略搜索量,以及每一条背后的新闻。把它挂到排程上,这张表就成了一份记录:什么时候发生了什么。

你要提供
Countries
你会拿到
11 列,来自 1 项设置
浏览器
不需要
它的输入项和全部 11 列 →

某个关键词下排在前面的视频,带播放量、频道、时长和发布时间。把 Keyword Ideas 卡片找到的词喂进来,这张表就能回答那些卡片回答不了的问题:已经有人在做了吗,做得怎么样。

你要提供
Keywords
你会拿到
14 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 14 列 →

某个关键词下排名的页面,按顺序,带标题和摘要。任何排名监测工具的底层其实都是它——把 Keyword Ideas 卡片找到的词交给它,每个词的竞争对手就都在表里了。

你要提供
Keywords
你会拿到
9 列,来自 4 项设置
浏览器
不需要
它的输入项和全部 9 列 →

围绕一个关键词正在上升的查询,附 Trends 自己的热度分值。这里唯一一张给出实测需求、而不是提示顺序的卡片——用它把正在增长的词和只是热门的词分开。

你要提供
Keywords
你会拿到
7 列,来自 4 项设置
浏览器
不需要
它的输入项和全部 7 列 →

视频里说过的每一句话,带时间戳,每条字幕一行。把它对准已经排在你关键词前面的那些视频,这张表就是它们讲了什么——也是写一份讲得更好的脚本的原料。

你要提供
Videos
你会拿到
10 列,来自 2 项设置
浏览器
不需要
它的输入项和全部 10 列 →

地点

商家和地址,来自收录它们的地图与名录。

地图搜索返回的每一个地点,落成表里的一行行,全程不开浏览器窗口:名称、类目、完整邮寄地址、电话、网站、评分、评论数,以及——你要的话——从商家自己网站上取到的邮箱地址。

你要提供
What to find
你会拿到
47 列,来自 13 项设置
浏览器
不需要
它的输入项和全部 47 列 →

社交

公开主页、它们发布过的内容,以及关注它们的人。

Instagram Profiles

需要账号建议挂代理

任何公开账号背后的完整资料头:简介、粉丝数和帖子数、认证状态、商业类目和简介里的那条链接——以及,你要的话,那条链接指向的网站上的邮箱地址。

你要提供
Accounts
你会拿到
34 列,来自 2 项设置
浏览器
一次,用来登录
它的输入项和全部 34 列 →

Instagram Posts

建议挂代理

一个公开账号发过的全部内容——帖子、轮播和 reels——带文案、时间、点赞、评论、播放量和媒体链接,从新到旧排列,每条一行。

你要提供
Accounts
你会拿到
27 列,来自 4 项设置
浏览器
不需要
它的输入项和全部 27 列 →

Instagram Followers

需要账号建议挂代理

谁关注了这个账号,或者它回关了谁:每一个都带用户名、姓名、认证状态和 Instagram 自己的 id,每个账号一行,可以直接和一张主页表拼接。

你要提供
Accounts
你会拿到
13 列,来自 3 项设置
浏览器
一次,用来登录
它的输入项和全部 13 列 →

任何一个公开主页地址背后的那个人:姓名、简介、城市、现任雇主、就读院校和粉丝数,每人一行,全部读自 LinkedIn 对未登录访客给出的那张页面。

你要提供
Profiles
你会拿到
21 列,来自 5 项设置
浏览器
不需要
它的输入项和全部 21 列 →

任何一个公开的 LinkedIn 公司主页背后的那家机构:名称、简介、标语、实时员工数、网站和注册城市,每家一行,读自 LinkedIn 对未登录访客给出的那张页面。

你要提供
Companies
你会拿到
29 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 29 列 →

任何一个公开的 LinkedIn 公司主页上的近期帖子:正文全文、标题、发布时间和帖子自己的地址,每条一行。LinkedIn 只给未登录访客嵌入其中七到十条,其余的挡在墙后,这张卡片采到的就是这些。

你要提供
Companies
你会拿到
11 列,来自 4 项设置
浏览器
不需要
它的输入项和全部 11 列 →

任何一个公开的 LinkedIn 帖子地址背后的那条内容:正文全文、作者、时间、互动总数、评论数和随附媒体,每条一行,读自 LinkedIn 对未登录访客给出的那张页面。

你要提供
Posts
你会拿到
21 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 21 列 →

在某条 LinkedIn 帖子下公开留言的人:姓名、留言内容、时间,以及收到多少个赞,每条评论一行。LinkedIn 只给未登录访客看前八到十条,其余挡住,而且从不显示那些只点了互动的人。

你要提供
Posts
你会拿到
10 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 10 列 →

TikTok Profiles

建议挂代理

任何一个公开 TikTok @用户名背后的账号:姓名、简介、简介里的链接、粉丝数、获赞数和视频数,每个账号一行,读自 TikTok 对未登录访客给出的那张页面。

你要提供
Accounts
你会拿到
24 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 24 列 →

TikTok Profile Videos

建议挂代理

任何一个公开 TikTok 账号最近的十条视频:文案、播放量、封面和视频自己的地址,每条一行。十条是 TikTok 对未登录访客设的上限,不是这张卡片的上限。

你要提供
Accounts
你会拿到
15 列,来自 4 项设置
浏览器
不需要
它的输入项和全部 15 列 →

TikTok Videos

建议挂代理

你有地址的那条视频,TikTok 公开的一切:播放、点赞、评论、分享、收藏和转发,文案连同其中的话题标签,配乐,作者和作者的各项计数,每条视频一行。

你要提供
Video URLs
你会拿到
39 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 39 列 →

一个用户名背后的账号:简介、粉丝数和关注数、发帖数、网站、所在地、注册日期和 X 自己的 id,每个账号一行,可以直接和一张帖子表拼接。

你要提供
Accounts
你会拿到
24 列,来自 1 项设置
浏览器
不需要
它的输入项和全部 24 列 →

X Posts

建议挂代理

一个账号发过的全部内容:正文、时间、点赞、转发、回复、引用、书签、话题标签、提及,以及 t.co 短链背后的真实链接,每条帖子一行。

你要提供
Accounts
你会拿到
27 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 27 列 →

按链接或 id 读取指定的帖子:正文、作者、点赞,以及底下的讨论串长到了什么程度。每条一次请求,也是整个目录里唯一一张任何凭据都不需要的卡片。

你要提供
Posts
你会拿到
19 列,来自 1 项设置
浏览器
不需要
它的输入项和全部 19 列 →

电商

各大平台上的商品、价格和卖家。

一家 Shopify 店铺公开的每一件商品:标题、价格、划线价、库存、SKU、供货商、类型、标签和图片,每件一行,直接取自店面自己的目录文件,不需要账号,也不开浏览器。

你要提供
Stores
你会拿到
22 列,来自 7 项设置
浏览器
不需要
它的输入项和全部 22 列 →

招聘

一家公司正在招的岗位,来自发布它们的招聘网站和招聘系统。

Indeed Jobs

建议挂代理

在 Indeed 上针对某个搜索投放的每一家雇主:岗位、公司、公司的评分和评价数、地点、薪资区间、工作类型和发布多久了,每个职位一行,不需要账号,也不开浏览器。

你要提供
Searches
你会拿到
27 列,来自 10 项设置
浏览器
不需要
它的输入项和全部 27 列 →

一家公司在 Greenhouse 上公开的每一个在招岗位:标题、地点、部门、办公地、发布时间和最后一次变动的时间,每个职位一行,取自招聘板自己的公开 API,不需要账号,也不开浏览器。

你要提供
Boards
你会拿到
16 列,来自 5 项设置
浏览器
不需要
它的输入项和全部 16 列 →

一家公司在 Ashby 上公开的每一个在招岗位:标题、团队、地点、办公形式、公开的薪资区间和上架时间,每个职位一行,取自招聘板自己的公开 API,不需要账号,也不开浏览器。

你要提供
Boards
你会拿到
21 列,来自 6 项设置
浏览器
不需要
它的输入项和全部 21 列 →

一家公司在 Lever 上公开的每一个在招岗位:标题、部门、团队、地点、办公形式和用工形式,每个职位一行,取自招聘板自己的公开 API,不需要账号,也不开浏览器。

你要提供
Boards
你会拿到
15 列,来自 5 项设置
浏览器
不需要
它的输入项和全部 15 列 →

怎么跑一个

打开「采集器」标签页,挑一张卡片,填好表单,按「开始」。从这里发起的每一次运行都会生成一张新表,以你搜索的内容和时间命名,收在以该采集器命名的文件夹里——所以同一张卡片跑两次绝不会互相覆盖。想先试试也可以:它只采一页,什么都不写,并告诉你哪些列拿回了内容。

你也可以完全不打开应用就跑一个。助手手里有整个目录,所以「把鹿特丹的牙医采下来」是一句话,而不是一张表单;同样这批工具也在给外部 Agent 用的 MCP 服务器上;而一个 Run scraper 步骤能把采集器放进工作流里。这个步骤是唯一能推翻上面「一次运行一张表」规则的调用方:不管它,它就和别的一样新建一张表;但如果指定一张你命名的表,它会在表不存在时按上面的列建好,之后每次运行都写进这张表——追加,或者按你指定的匹配列就地更新。这样一来,排程上的采集是把一张表养大,而不是每晚留下一张。无论哪种方式,这个步骤都会把表名、表 id 和行数交给下一步。

它们不做什么

这里几乎没有什么需要登录。未登录读取公开页面是已成定论的做法——Bright Data 未登录采集 Meta 并且胜诉,hiQ 登录后采集 LinkedIn 则败诉——所以一张需要账号的卡片,是把一个已定论的问题重新变成开放问题。每一张这样的卡片都是单独作出的决定,而不是默认行为。LinkedIn 在这里完全以未登录方式读取,正是出于这个原因。

有 2 张卡片要账号,而且只出现在网站根本没留下任何未登录来源的地方——不是那种登录之后只是能拿到更多的地方:

  • Instagram Profiles对于未登录的请求,Instagram 已经不再返回主页简介、粉丝数和简介链接,只给一个空壳。这张卡片需要一个自己的账号才能读到它们。Argus 里其余的一切仍然在未登录状态下采集。
  • Instagram Followers粉丝列表是 Instagram 唯一只回应已登录请求的东西:未登录时,任何提供它的接口都返回 401「login required」,从哪个地址去问都一样。这张卡片需要一个自己的账号才能读到,用一个随时可弃的小号最合适。Argus 里其余的一切仍然在未登录状态下采集。

即便如此,采集过程也不会打开任何浏览器窗口。窗口只手动打开一次,让你登录;此后的每一个请求,都和其他卡片一样是普通 HTTP。请用一个随时可弃的小号——自动化采集违反这些网站的条款,承载它的账号可能被封停。

它们都不会去驱动页面。凡是需要真实浏览器的事——背后没有列表接口的网站,或者任何操作你自己账号的事——都归自动化流程管。

这里也没有「帮我把这个网址采下来」。采集器是为某个指定服务写的卡片,是照着那个服务自己的返回内容写出来、也是照着它测出来的。要采一个没有卡片覆盖的网站,请改用自动化流程