ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

一份配置爬完七大平台:MediaCrawler 免JS逆向的实用上手指南

一份配置爬完七大平台:MediaCrawler 免JS逆向的实用上手指南 一份配置爬完七大平台MediaCrawler 免JS逆向的实用上手指南【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler想知道小红书上平价精华的热帖有多少、评论区在吐槽什么抖音竞品视频评论涨得快不快B站多久更新一次。手动一条条抄抄一天也攒不出数。MediaCrawler 干的正是这种跨平台、批量、带评论的数据采集活儿一次运行把小红书、抖音、快手、B站、微博、贴吧、知乎七个平台的笔记、视频、帖子甚至二级评论都带出来输出 JSON、CSV、Excel 或数据库。为什么不用JS逆向浏览器替你干了原理就一句话Playwright 驱动真实浏览器完成登录和请求签名由页面环境直接产出。不用懂 X-S 怎么算浏览器替你搞定登录态缓存后下次运行免扫码。以前写过爬虫都知道签名逆向往往是一个项目劝退的地方。这类多平台爬虫框架把这部分整个丢进了浏览器你面对的只剩配置项。三个决策点跑通第一个任务环境准备一句话带过Python ≥3.11、较新的 ChromeCDP 模式要求 144 以上要爬抖音或知乎就再装个 Node.js v16二者的签名逻辑依赖 Node 执行。git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync装完就这些。咱们把怎么爬收敛成三个选择都在config/base_config.py里。选平台改PLATFORM xhs这一行即可。七个取值xhs小红书、dy抖音、ks快手、biliB站、wb微博、tieba贴吧、zhihu知乎。选取数方式CRAWLER_TYPE三选一对应三种取数目的方式取值在哪填产出关键词搜索searchKEYWORDS多个用英文逗号分隔搜索结果的笔记/视频列表及评论指定帖子detail各平台配置文件的 URL/ID 列表单条内容的完整字段与评论创作者主页creator各平台配置文件的主页 URL 列表该账号发布的全部内容小红书detail模式的链接要直接从浏览器地址栏复制需带xsec_token参数监控 B 站账号更新节奏则把主页链接填进config/bilibili_config.py的BILI_CREATOR_ID_LIST。选存储出口SAVE_DATA_OPTION json切换格式。json/jsonl方便后续用 Python 处理excel/csv给运营同事直接打开看sqlite/postgres入库天然带去重适合长期反复采集同一批对象mongodb是数据量大时的扩展选项。默认存到data/目录入库模式自动建表详细说明见数据存储指南。三个选择做完改的就是这四行PLATFORM xhs KEYWORDS 平价精华 CRAWLER_TYPE search SAVE_DATA_OPTION json跑起来python main.py首次运行会弹出浏览器窗口扫码登录二维码、手机号都支持。登录态缓存在本地目录后续运行免扫码结果文件落在data/里。能力三层递进从单平台搜索到规模化采集基础层单平台搜索 文件输出。CRAWLER_TYPE search配CRAWLER_MAX_NOTES_COUNT控制单次条数。新品上市前把竞品品牌名和品类词填进KEYWORDS条数调到 50几分钟就能拿到笔记标题、正文、点赞收藏评论数和发布时间做竞品声量摸底刚好够用。进阶层评论区变成分析素材。ENABLE_GET_COMMENTS True # 一级评论默认开 ENABLE_GET_SUB_COMMENTS True # 二级评论默认关 ENABLE_GET_WORDCLOUD True # 评论词云默认关CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES控制单篇抓多少条评论抖音评论抓取想拿全就调大它词云配合停用词文件docs/hit_stopwords.txt一词一行使用完整用法见词云图使用配置知乎舆情收集可以这么用评论数量调大、入库存储再按发布时间排序就是话题热度的时间序列规模化层大批量自媒体数据采集不触风控。ENABLE_IP_PROXY True开启代理 IP 池启动时从服务商拉取一批 IP逐个验证可用性后随机轮换失效或过期自动补新ENABLE_IP_PROXY True IP_PROXY_PROVIDER_NAME kuaidaili服务商的用户名密码或 API 密钥通过环境变量传入项目并发保持MAX_CONCURRENCY_NUM 1稳定后再上调数据库入库自动建表去重长期监控任务不会越跑越重复。代理配置细节见代理使用踩坑速查从症状到操作小红书扫码后滑块验证反复出现登录卡死→ 多半是 CDP 没生效或用了无痕窗口。ENABLE_CDP_MODE与CDP_CONNECT_EXISTING都设True并把HEADLESS设为False重启后手动过一次滑块仍不行就删除brower_data/目录重新登录。详见CDP模式使用指南。报 execjs 或 JS 执行错误抖音、知乎最常见→ Node.js 没装或版本低于 v16。装好 Node.js v16重启终端再跑。前几天正常跑着跑着突然抓不到数据→ 账号大概率触发了平台风控。调大CRAWLER_MAX_SLEEP_SEC到 3~5 秒、减少单次采集条数还不行就开代理池分散 IP。CDP 连不上浏览器或 playwright 超时→ Chrome 没打开、版本低于 144或调试端口没起来。地址栏输chrome://version确认版本再到chrome://inspect/#remote-debugging勾选远程调试确认显示Server running at: 127.0.0.1:9222弹出确认框就点接受程序最多等 60 秒。大批量任务想跑得更稳→ 盲目加并发、压太低间隔是风控的头号诱因。并发保持 1、SAVE_LOGIN_STATE保持开启复用登录态只取元数据就保持ENABLE_GET_MEDIA关闭省带宽也省磁盘。克隆仓库改 4 行配置跑python main.py第一批数据就出来了。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表