PHP采集程序原理分析篇

全栈程序员-站长 • 2026年3月17日下午9:20 • 未分类 • 阅读 2

由于需要，要写一个简单的PHP采集程序，照例是到网上找了一堆教程，然后照猫画虎，可是发现网上的教程全是似是而非，没有一个真正能用的。苦想了几天，终于弄明白了里面的道理。在这里写出来，请高手指正。

采集程序的思路很简单，无非就是先打一个页面，一般都是列表页，取得里面全部链接的地址，然后打开逐条链接，寻找我们感兴趣的东西，如果找到，就把它入库或别的处理。下面以一个很简单的例子来说说。

首先确定一个采集页，一般就是列表面了。这里目标是:http://www.php100.com/article/11/index.htm。这是一个列表页，我们的目的就是采集这个列表页上全部的文章。有列表页了，第一步先打开它，把它的内容纳入到我们的程序中来。一般用fopen或是file_get_contents这两个函数，我们这里用fopen作例子。怎么打开它呢？很简单：$source=fopen(“[url=http://www.php100.com/article/11/index.htm”,]http://www.php100.com/article/11/index.htm”,’r'[/url])；实际上已经把内容纳入到我们的程序中来了。注意得到的$source是一个资源，不是可处理的文本，所以再用函数fread将内容读到一个变量中，这次就是真正的可编辑的文本了。例子：

$content=fread($source,99999);后面的数字表示字节数，填个大的就行。你用file_put_contents将$content写入到一个文本文件，可以看出里面的内容其实就是网页的源码。得到了网页的源码，我们就要分析里面的文章链接地址，这里要用到正则表达式了，[推荐正则表达式教程（http://www.php100.com/article/7/all/545.1.htm）]。通过查看源代码，我们可以看到里面文章的链接地址全是这个样子

http://www.php100.com/article/10/all/273.1.htm“>　　将数据库连接代码封装在函数里，在需要读取时调用..

我们就可以写正则表达式了。$count=preg_match_all(“/

(.+?)<\/a>/”,$content,$art_list);

其中数组$art_list[1][$s]里面包含的就是某个文章的链接地址。而$art_list[2][$s]包含的就是某一文章的标题。到了这一步就可以算成功了一半了。

中间就是采集内容的部分了，省略了

发布者：全栈程序员-站长，转载请注明出处：https://javaforall.net/220062.html原文链接：https://javaforall.net

PHP采集程序原理分析篇

关于作者

全栈程序员-站长

发表回复

PHP采集程序原理分析篇

关于作者

全栈程序员-站长

相关推荐

设置页数自增页眉/页脚——Word中page域代码的使用

Sublime Text3中几款比较好看的主题

前端js获取当前时间的方法

xmind换行「建议收藏」

OpenClaw快速上手指南：安装、配置与使用教程

学习如何搭建SpringBoot框架

发表回复