MediaCrawler:3 条命令跑通 7 大社媒平台数据采集
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
想采集小红书、抖音、快手、B 站、微博、贴吧、知乎的公开笔记、视频和评论,逐个平台写爬虫太折腾。MediaCrawler 是一个开源的多平台媒体数据采集工具,克隆仓库、改几行配置就能上手,下面用"采集一次小红书笔记"的真实流程带你走一遍。
先把项目跑起来
先装好 uv 包管理器(它会自动处理 Python 环境和依赖),如果还要采集抖音、知乎,另外装个 Node.js 16+。
git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && uv sync项目默认走 CDP 模式连接你本机的 Chrome,复用浏览器里已有的登录态和 Cookie,对风控更友好。运行前在 Chrome 地址栏打开chrome://inspect/#remote-debugging开启远程调试即可。然后执行第一条采集命令:
uv run main.py --platform xhs --lt qrcode --type search浏览器会自动弹出,手机扫码登录,它就按配置文件里的关键词逐页抓帖子和评论。Chrome 弹出确认框时点一下接受就行。
换个平台只改一个文件
参数都在 config/ 目录下,各平台一份配置文件,外加公共的 config/base_config.py,全部带中文注释:KEYWORDS是搜索关键词,CRAWLER_TYPE在搜索、指定帖子详情、创作者主页三种模式里选,CRAWLER_MAX_NOTES_COUNT控制单次采集多少条,ENABLE_GET_COMMENTS控制要不要抓评论。
想换到抖音,把命令行参数改成--platform dy,再改对应平台配置里的关键词,爬虫代码一行都不用碰。
数据最终存在哪
默认落到data/目录下的 jsonl 文件,一行一条数据,方便后续处理。想直接看 Excel,命令后加--save_data_option excel,会生成带格式的多工作表文件;想查重、做查询,建议入库——先执行uv run main.py --init_db sqlite初始化,再把存储选项指到 SQLite 即可,更多组合见 docs/data_storage_guide.md。
被限流、断网了怎么办
一次采得多,很容易触发平台风控。项目内置了代理 IP 池,逻辑在 proxy/ 目录:从代理提供商拉取 IP,缓进 Redis,请求时轮换使用。
代理IP池工作流程图
开启的话,把基础配置里的ENABLE_IP_PROXY改成True,再在IP_PROXY_PROVIDER_NAME里选提供商,内置快代理、豌豆 HTTP 和静态代理三种。
不想敲命令?有可视化界面
项目自带 WebUI:两个终端分别启动后端 API 服务和前端开发服务,浏览器打开就能选平台、选登录方式、设采集类型,日志实时回显。
改个平台、改个关键词,同一套代码就能复用去 7 个站点,学架构、做数据研究都够用了。
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考