← 返回目录
S

Supadata MCP Server

官方
通过 Supadata 为 LLM 客户端提供视频转录与网页抓取能力
GitHub 源仓库 ↗
★ 62 Stars 分类 · 开发工具 热门 源版本 e5c895904cbe
54FMRS · D
可靠性
8/20
安全与权限
12/20
维护活跃度
11/20
文档质量
13/20
安装易用性
10/20

Supadata MCP Server 是官方维护的服务器,功能覆盖视频转录、网页抓取/爬取及 AI 结构化提取,内置重试与限流机制,适合需要多平台内容采集的开发者;但依赖 Supadata 第三方 API 密钥和服务,不适合无法接受数据外发或有严格合规要求的场景。

查看 FMRS 评分方法 →

Supadata MCP Server 是 Supadata 官方维护的模型上下文协议服务器,将视频转录提取、网页抓取、网站爬取与 URL 发现能力接入 Cursor、Claude 等任意 LLM 客户端。它支持从 YouTube、TikTok、Instagram、Twitter 及文件 URL 提取转录文本,获取媒体元数据(平台信息、标题、描述、作者信息、互动数据、标签、发布时间等),并可用 AI 从视频内容中提取结构化数据。网页方面提供单页抓取、多页爬取及站内 URL 发现功能。内置自动重试与限流机制,可通过配置参数调整重试次数、延迟与退避倍数。使用需要提供 SUPADATA_API_KEY 环境变量以调用 Supadata 的后端 API。

工具能力

supadata_transcript
从支持的视频平台(YouTube、TikTok、Instagram、Twitter)及文件 URL 提取转录文本,可指定语言。
supadata_check_transcript_status
通过任务 ID 查询转录提取任务的进度。
supadata_metadata
获取媒体 URL 的元数据,包括平台信息、标题、描述、作者详情、互动数据、媒体详情、标签及创建日期。
supadata_extract
使用 AI 从视频 URL 中提取结构化数据,可提供提示词和/或 JSON Schema 定义输出格式,返回用于异步查询的任务 ID。
supadata_check_extract_status
通过任务 ID 查询结构化提取任务的进度。
supadata_scrape
从单个 URL 抓取内容,支持语言等高级选项。
supadata_map
发现网站上所有已索引的 URL,便于在抓取前定位相关页面。
supadata_crawl
启动异步爬取任务,从网站的多个相关页面提取内容。
supadata_check_crawl_status
通过任务 ID 查询爬取任务的进度。

安装接入

  1. 在 Supadata 官网获取 API 密钥,并设置环境变量 SUPADATA_API_KEY。2. 参照 Supadata 官方集成指南(docs.supadata.ai/integrations/mcp)为 Claude、ChatGPT、Cursor、Windsurf、VS Code 等客户端完成 MCP 服务器配置。3. 如需本地开发或二次构建,可克隆仓库后执行 npm install 与 npm run build。

选型与风险

适合谁

  • 需要将视频转录整合进内容处理流程的开发者
  • 构建研究或摘要工具、需要网页与视频数据的 AI 应用开发者
  • 需要站内 URL 发现与多页内容爬取的自动化流程

不适合谁

  • 需要通用浏览器自动化(点击、登录、表单交互)的场景
  • 对目标网站服务条款有严格合规要求且未经确认的抓取任务
  • 不希望将目标 URL 或内容发送至第三方 Supadata API 的隐私敏感场景

所需权限

  • 需要有效的 SUPADATA_API_KEY 以调用 Supadata API
  • 需要出站网络访问以请求目标视频平台与网页 URL

风险与副作用

  • 请求的 URL 及抓取内容会发送至第三方 Supadata 服务处理,存在数据外泄风险
  • API 密钥若配置不当可能被滥用,产生额外调用费用
  • 抓取或爬取目标网站可能违反其服务条款或版权限制
  • 异步任务(转录、提取、爬取)依赖 Supadata 服务可用性与限流策略

常见排障

  1. 确认已正确设置 SUPADATA_API_KEY 环境变量
  2. 转录、提取、爬取为异步任务,需使用对应的 check_status 工具轮询任务 ID 获取结果
  3. 确认目标 URL 属于受支持平台(YouTube、TikTok、Instagram、Twitter)或为可访问的文件/网页 URL
  4. 如遇失败,检查网络连通性及 Supadata 服务的限流与重试配置(maxAttempts、initialDelay、maxDelay、backoffFactor)

使用场景

批量提取 YouTube/TikTok/Instagram/Twitter 视频的转录文本
抓取单个网页内容用于摘要或知识库构建
爬取博客或文档站点的多个相关页面
在抓取前发现网站的完整 URL 列表
获取视频元数据(标题、作者、互动数据等)
用 AI 从视频内容中提取结构化信息

支持客户端

Claude完整支持
ChatGPT完整支持
Cursor完整支持
Windsurf完整支持
VS Code完整支持