MediaCrawler/README.md

12 KiB
Raw Permalink Blame History

🔥 自媒体平台爬虫🕷️MediaCrawler🔥

NanmiCoder%2FMediaCrawler | Trendshift

GitHub Stars GitHub Forks GitHub Issues GitHub Pull Requests License

免责声明:

大家请以学习为目的使用本仓库⚠️⚠️⚠️⚠️爬虫违法违规的案件

本仓库的所有内容仅供学习和参考之用,禁止用于商业用途。任何人或组织不得将本仓库的内容用于非法用途或侵犯他人合法权益。本仓库所涉及的爬虫技术仅用于学习和研究,不得用于对其他平台进行大规模爬虫或其他非法行为。对于因使用本仓库内容而引起的任何法律责任,本仓库不承担任何责任。使用本仓库的内容即表示您同意本免责声明的所有条款和条件。

点击查看更为详细的免责声明。点击跳转

仓库描述

小红书爬虫抖音爬虫 快手爬虫 B站爬虫 微博爬虫百度贴吧爬虫知乎爬虫...。
目前能抓取小红书、抖音、快手、B站、微博、贴吧、知乎等平台的公开信息。

原理:利用playwright搭桥保留登录成功后的上下文浏览器环境通过执行JS表达式获取一些加密参数 通过使用此方式免去了复现核心加密JS代码逆向难度大大降低

功能列表

平台 关键词搜索 指定帖子ID爬取 二级评论 指定创作者主页 登录态缓存 IP代理池 生成评论词云图
小红书
抖音
快手
B 站
微博
贴吧
知乎

安装部署方法

开源不易希望大家可以Star一下MediaCrawler仓库十分感谢

创建并激活 python 虚拟环境

如果是爬取抖音和知乎需要提前安装nodejs环境版本大于等于16即可

# 进入项目根目录
cd MediaCrawler

# 创建虚拟环境
# 我的python版本是3.9.6requirements.txt中的库是基于这个版本的如果是其他python版本可能requirements.txt中的库不兼容自行解决一下。
python -m venv venv

# macos & linux 激活虚拟环境
source venv/bin/activate

# windows 激活虚拟环境
venv\Scripts\activate

安装依赖库

pip install -r requirements.txt

安装 playwright浏览器驱动

playwright install

运行爬虫程序

### 项目默认是没有开启评论爬取模式如需评论请在config/base_config.py中的 ENABLE_GET_COMMENTS 变量修改
### 一些其他支持项也可以在config/base_config.py查看功能写的有中文注释

# 从配置文件中读取关键词搜索相关的帖子并爬取帖子信息与评论
python main.py --platform xhs --lt qrcode --type search

# 从配置文件中读取指定的帖子ID列表获取指定帖子的信息与评论信息
python main.py --platform xhs --lt qrcode --type detail
  
# 打开对应APP扫二维码登录
  
# 其他平台爬虫使用示例,执行下面的命令查看
python main.py --help    

数据保存

  • 支持关系型数据库Mysql中保存需要提前创建数据库
    • 执行 python db.py 初始化数据库数据库表结构(只在首次执行)
  • 支持保存到csv中data/目录下)
  • 支持保存到json中data/目录下)

MediaCrawlerPro重磅发布啦

主打学习成熟项目的架构设计不仅仅是爬虫Pro中的其他代码设计思路也是值得学习欢迎大家关注

订阅Pro源代码访问权限可以加我微信yzglan备注Pro有一定的门槛💰

MediaCrawlerPro 版本已经重构出来了,相较于开源版本的优势:

  • 多账号+IP代理支持重点
  • 去除Playwright依赖使用更加简单
  • 支持linux部署Docker docker-compose
  • 代码重构优化更加易读易维护解耦JS签名逻辑
  • 代码质量更高,对于构建更大型的爬虫项目更加友好
  • 完美的架构设计,更加易扩展,源码学习的价值更大

其他常见问题可以查看在线文档

在线文档包含使用方法、常见问题、加入项目交流群等。 MediaCrawler在线文档

开发者服务

如果你对知识付费认可,可以看下下面我提供的付费服务,如果你是学生,请一定提前告知,会有优惠💰

感谢下列Sponsors对本仓库赞助支持

给好朋友新书站台推荐

好朋友 自动化测试框架设计 - Python 的新书📚出版啦,强力推荐!!!京东购书5折链接

打赏-微信

框架的设计http接口封装、数据库操作设计、UI自动化selenium、playwright、appium这些跟爬虫其实也大差不差值得学习

关于虫师 Github千星开源仓库seldom作者、博客园知名大V已出版的多类书籍

MediaCrawler项目微信交流群

加入微信交流群

打赏

如果觉得项目不错的话可以打赏哦。您的支持就是我最大的动力!

打赏时您可以备注名称,我会将您添加至打赏列表中。

打赏-微信 打赏-支付宝

查看打赏列表 MediaCrawler捐赠名单

爬虫入门课程

我新开的爬虫教程Github仓库 CrawlerTutorial ,感兴趣的朋友可以关注一下,持续更新,主打一个免费.

star 趋势图

  • 如果该项目对你有帮助,帮忙 star一下 ❤️❤️❤️让更多的人看到MediaCrawler这个项目

Star History Chart

参考

免责声明

1. 项目目的与性质

本项目(以下简称“本项目”)是作为一个技术研究与学习工具而创建的,旨在探索和学习网络数据采集技术。本项目专注于自媒体平台的数据爬取技术研究,旨在提供给学习者和研究者作为技术交流之用。

2. 法律合规性声明

本项目开发者(以下简称“开发者”)郑重提醒用户在下载、安装和使用本项目时,严格遵守中华人民共和国相关法律法规,包括但不限于《中华人民共和国网络安全法》、《中华人民共和国反间谍法》等所有适用的国家法律和政策。用户应自行承担一切因使用本项目而可能引起的法律责任。

3. 使用目的限制

本项目严禁用于任何非法目的或非学习、非研究的商业行为。本项目不得用于任何形式的非法侵入他人计算机系统,不得用于任何侵犯他人知识产权或其他合法权益的行为。用户应保证其使用本项目的目的纯属个人学习和技术研究,不得用于任何形式的非法活动。

4. 免责声明

开发者已尽最大努力确保本项目的正当性及安全性,但不对用户使用本项目可能引起的任何形式的直接或间接损失承担责任。包括但不限于由于使用本项目而导致的任何数据丢失、设备损坏、法律诉讼等。

5. 知识产权声明

本项目的知识产权归开发者所有。本项目受到著作权法和国际著作权条约以及其他知识产权法律和条约的保护。用户在遵守本声明及相关法律法规的前提下,可以下载和使用本项目。

6. 最终解释权

关于本项目的最终解释权归开发者所有。开发者保留随时更改或更新本免责声明的权利,恕不另行通知。

感谢JetBrains提供的免费开源许可证支持

JetBrains