@zero-ai-bits/doc-spider-mcp
v1.0.0
Published
MCP server for reading webpages and extracting technical docs.
Readme
Doc Spider MCP 🕷️
doc-spider-mcp 是一个支持 Model Context Protocol (MCP) 的网页阅读与抓取服务。它利用 Playwright 与 Readability,完美支持现代单页应用 (SPA) 与技术文档的内容抓取,自动提取网页的核心 Markdown 内容,并智能追踪“下一页”或侧边栏菜单,帮助大模型(LLM)实现批量、有序的技术文档学习。
🌟 特性
- 精准内容提取:基于
@mozilla/readability,自动过滤广告、页脚等无关信息。 - SPA/现代文档友好:底层使用 Playwright 无头浏览器,轻松应对 Docusaurus, VitePress, Next.js 等前端渲染文档。
- Token 极简:利用 Turndown 将网页提取为干净的 Markdown 格式。
- 智能链接分析:自动寻找文档的
[下一页]按钮和侧边栏菜单结构。 - 批量序列阅读:支持输入首个文档页面,自动顺藤摸瓜抓取整个教程序列。
📦 安装与配置
作为 MCP 服务使用时,推荐直接在支持 MCP 的 IDE(如 Cursor, Claude Desktop, Antigravity)中通过 npx 运行:
Cursor / Antigravity 配置示例
"mcpServers": {
"doc-spider": {
"command": "npx",
"args": ["-y", "doc-spider-mcp"]
}
}Claude Desktop 配置示例 (claude_desktop_config.json)
{
"mcpServers": {
"doc-spider": {
"command": "npx",
"args": ["-y", "doc-spider-mcp"]
}
}
}🛠️ MCP 工具列表 (Tools)
本服务提供以下核心 MCP Tools 供大模型调用:
read_page- 描述:读取指定网页,提取核心内容为 Markdown,并获取该网页的下一页链接及同级菜单。
- 参数:
url(string)
read_docs_sequence- 描述:自动序列阅读文档。给定起始页,会自动点击“下一页”抓取指定页数,最后合并输出。适合一口气阅读长篇教程或完整的 API 说明。
- 参数:
startUrl(string),maxPages(number, 默认 3)
extract_page_menu- 描述:仅提取页面的导航链接和菜单(不抓取正文),帮助 AI 快速了解站点的文档架构。
- 参数:
url(string)
💻 开发者本地调试
# 安装依赖
npm install
# 编译 TypeScript
npm run build
# 运行 MCP Server
npm start