Python即时网络爬虫项目启动说明

Fuller

   作为酷爱编程的老程序员，实在按耐不下这个冲动，Python真的是太火了，不断撩拨我的心。

   我是对Python存有戒备之心的，想当年我基于Drupal做的系统，使用php语言，当语言升级了，推翻了老版本很多东西，不得不花费很多时间和精力去移植和升级，至今还有一些隐藏在某处的代码埋着雷。我估计Python也避免不了这个问题（其实这种声音已经不少，比如Python 3 正在毁灭 Python）。

   但是，我还是启动了这个Python即时网络爬虫项目。我用C++、Java和Javascript编写爬虫相关程序超过10年，要追求高性能，非C++莫属，同时有完善的标准体系，让你和你的系统十分自信，只要充分测试，就能按照预期的方式运行。在GooSeeker项目中，我们不断向一个方向努力——“收割数据”，而且让广大用户（不仅是专业的数据采集用户）都能体验到收割互联网数据的快感。“收割”的一个重要含义就是大批量。现在，我要启动“即时网络爬虫”，目的是要补充“收割”没有覆盖的场景，我看到的是：

在系统层面：“即时”代表快速部署数据应用系统
在数据流层面：“即时”代表采集数据到数据使用是即时的，单个数据对象可以独自全流程处理，不用等待一批存入数据库，然后从数据库中拿出来用
“即时”另一个含义就是网络爬虫是一个嵌入模块，跟整个信息处理系统集成在一起

   一众程序员都在玩Python网络爬虫，我拟定了一个计划：建立一个模块化更强的软件部件，专门解决最耗费精力的内容提取问题（有人总结说大数据和数据分析整个链条上，数据准备占了80%工作量，我们不妨延展一下，网络数据抓取的工作量有80%是在为各种网站的各种数据结构编写抓取规则）。

   我把他想象成一个小机器（见上图），输入的是原始网页，输出的是提取出来的结构化的内容，这个小机器还有一个可替换部件：将输入转化成输出结构的一个指令块，我们成为“提取器”，让大家不再为调试正则表达式或者XPath而苦恼。

   这是一个开放的项目，两年前启动了一个手机上的即时网络爬虫项目，因为是给某商业集团开发的，所以不便开放，同样的思想和方法将开放到这个项目中，而且用当前最热的python来做，希望大家能共同参与。在执行过程中，我们会开放所有资料和成果、已经遇到的坑。

   近期做的实验是

wangyong · 发表于 2019-11-1 16:17:04

本帖最后由 wangyong 于 2019-11-1 17:09 编辑

使用快捷采集，不用做规则，输入网址就能采集，快捷采集入口：https://www.gooseeker.com/res/datadiy.html?category=%E7%83%AD%E9%97%A8%E7%BD%91%E7%AB%99&web=%E6%96%B0%E6%B5%AA%E5%BE%AE%E5%8D%9A&rule=%20TA%E7%82%B9%E8%B5%9E%E8%BF%87%E7%9A%84%E5%BE%AE%E5%8D%9A%E6%95%B0%E6%8D%AE

xandy · 发表于 2016-5-6 14:40:35

mosung · 发表于 2016-6-25 20:58:57

楼主好魄力！

806446828 · 发表于 2016-7-19 15:15:19

期待ing

DK_MySoul · 发表于 2016-10-22 11:54:21

顶楼主

xtuisoft · 发表于 2017-4-9 23:16:37

发现这个网站就像发现了金矿，楼主太威武了。

maomao · 发表于 2017-4-9 23:19:33

xtuisoft 发表于 2017-4-9 23:16
发现这个网站就像发现了金矿，楼主太威武了。

因为资源有限，这个项目没有做完，只做了基础部分，很多api还没有做

luke4java · 发表于 2017-8-12 16:13:56

楼主有说到让scrapy 的spider更通用的思路特别好，正好在我的一个项目中用到了。

YuYork · 发表于 2017-11-9 09:45:04

楼主大大，如何让我们共同参与呀？

Fuller · 发表于 2017-11-9 10:01:57

YuYork 发表于 2017-11-9 09:45
楼主大大，如何让我们共同参与呀？

这个项目暂时搁置了

Python即时网络爬虫项目启动说明

本帖子中包含更多资源

相关帖子

共 13 个关于本帖的回复最后回复于 2023-7-17 23:41

推荐板块

精彩推荐

热门话题

热门用户

	B Color Image Link Quote Code Smilies 高级模式您需要登录后才可以回帖登录 \| 立即注册回帖并转播回帖后跳转到最后一页

Python即时网络爬虫项目启动说明

本帖子中包含更多资源

相关帖子

共 13 个关于本帖的回复 最后回复于 2023-7-17 23:41

推荐板块

精彩推荐

热门话题

热门用户

共 13 个关于本帖的回复最后回复于 2023-7-17 23:41