午夜福利院在线观看免费,天堂最新版在线,色噜噜精品一区二区三区,无码一区二区三区中文字幕,丝袜美腿一区二区三区

首頁(yè)>文檔>技術(shù)文檔>PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法

此組別內(nèi)的文章

需要支持?

如果通過(guò)文檔沒辦法解決您的問(wèn)題,請(qǐng)?zhí)峤还潍@取我們的支持!

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法

什么叫采集?

????就是使用PHP程序,把其他網(wǎng)站中的信息抓取到我們自己的數(shù)據(jù)庫(kù)中、網(wǎng)站中。

????PHP制作采集的技術(shù)

????從底層的socket到高層的文件操作函數(shù),一共有3種方法可以實(shí)現(xiàn)采集。

????1. 使用socket技術(shù)采集:

????socket采集是最底層的,它只是建立了一個(gè)長(zhǎng)連接,然后我們要自己構(gòu)造http協(xié)議字符串去發(fā)送請(qǐng)求。

????例如要想獲取這個(gè)頁(yè)面的內(nèi)容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket寫如下:

<?php
//連接,$error錯(cuò)誤編號(hào),$errstr錯(cuò)誤的字符串,30s是連接超時(shí)時(shí)間
$fp=fsockopen("www.youku.com",80,$errno,$errstr,30);
if(!$fp) die("連接失敗".$errstr);
 
//構(gòu)造http協(xié)議字符串,因?yàn)閟ocket編程是最底層的,它還沒有使用http協(xié)議
$http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n";   //  \r\n表示前面的是一個(gè)命令
$http.="Host:www.youku.com\r\n";  //請(qǐng)求的主機(jī)
$http.="Connection:close\r\n\r\n";   // 連接關(guān)閉,最后一行要兩個(gè)\r\n
 
//發(fā)送這個(gè)字符串到服務(wù)器
fwrite($fp,$http,strlen($http));
//接收服務(wù)器返回的數(shù)據(jù)
$data='';
while (!feof($fp)) {
$data.=fread($fp,4096);  //fread讀取返回的數(shù)據(jù),一次讀取4096字節(jié)
}
//關(guān)閉連接
fclose($fp);
var_dump($data);
?>

????打印出的結(jié)果如下,包含了返回的頭信息及頁(yè)面的源碼:

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖

????2.?使用curl_一套函數(shù)

????curl把HTTP協(xié)議都封裝成了很多函數(shù),直接傳相應(yīng)參數(shù)即可,降低了編寫HTTP協(xié)議字符串的難度。

????前提:在php.ini中要開啟curl擴(kuò)展。

//生成一個(gè)curl對(duì)象
$curl=curl_init();
//設(shè)置URL和相應(yīng)的選項(xiàng)
curl_setopt($curl, CURLOPT_URL, "http://www.youku.com");
curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //將curl_exec()獲取的信息以字符串返回,而不是直接輸出。
//執(zhí)行curl操作
$data=curl_exec($curl);
var_dump($data);

????打印出的結(jié)果如下,只包含頁(yè)面的源碼:

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖1

????3.?直接使用file_get_contents(最頂層的)

????前提:在php.ini中設(shè)置允許打開一個(gè)網(wǎng)絡(luò)的url地址。

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖2
//使用file_get_contents()
$data=file_get_contents("http://www.youku.com");
var_dump($data);
PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖3

????3種方式的選擇

????網(wǎng)絡(luò)之間通信主要使用的是以上三種。其中后兩種用的較多:如果要批量采集大量的數(shù)據(jù)時(shí)使用第二種【CURL】,性能好、穩(wěn)定。

????偶爾發(fā)幾個(gè)請(qǐng)求發(fā)的頻繁不密集時(shí)使用第三種。

????擴(kuò)展:圖片的防盜鏈如何破?

????比如7060網(wǎng)站上的圖片做了防盜鏈:在他的網(wǎng)站中可以看到圖片,把圖片拿到站外就無(wú)法訪問(wèn)。

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖4

????原理:在HTTP協(xié)議中有一個(gè)referer項(xiàng),代表發(fā)這個(gè)請(qǐng)求的來(lái)源地址,服務(wù)器會(huì)判斷如果這個(gè)請(qǐng)求不是這個(gè)網(wǎng)站發(fā)來(lái)的就會(huì)過(guò)濾掉這個(gè)請(qǐng)求:

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖5

????解決辦法:發(fā)HTTP時(shí)自己模擬referer即可:

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖6

????擴(kuò)展:有些要采集數(shù)據(jù)時(shí)時(shí)必須先登錄,可以使用模擬的試模擬在登錄狀態(tài)下的采集:

????a.?先用瀏覽登錄一下,登錄完,瀏覽器的COOKIE中就會(huì)有SESSIONID

????b. 發(fā)PHP發(fā)HTTP協(xié)議時(shí),把瀏覽器中的SESSIONID放到PHP的HTTP協(xié)議請(qǐng)求里,這樣就在以登錄的狀態(tài)發(fā)請(qǐng)求。

????總結(jié):所有客戶端發(fā)過(guò)來(lái)的數(shù)據(jù)都可以被模擬,所以服務(wù)器上的程序必須要必要的地方過(guò)濾客戶端的數(shù)據(jù)。

????什么時(shí)候用以上東西?接口開發(fā)時(shí)、采集時(shí)。

????數(shù)據(jù)采集

????例如我要采集這個(gè)url里的所有美國(guó)電影的信息,

????http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

????則先要知道電影所在的節(jié)點(diǎn)的結(jié)構(gòu),我們使用firebug查看。

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖7

????然后開始寫代碼:完整代碼如下

/**
 * 發(fā)一個(gè)GET請(qǐng)求獲取數(shù)據(jù)
 */
function get($url)
{
   global $curl;
   // 配置curl中的http協(xié)議->可配置的薦可以查PHP手冊(cè)中的curl_
   curl_setopt($curl, CURLOPT_URL, $url);
   curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE);
   curl_setopt($curl, CURLOPT_HEADER, FALSE);
   // 執(zhí)行這個(gè)請(qǐng)求
   return curl_exec($curl);
}
 
// 生成一個(gè)curl對(duì)象
$curl = curl_init();
$url='http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html';
$data=get($url);
// 匹配電影所在位置
$list_preg = '/<li class="yk-col4 mr1">.+<\/li>/Us';
// 匹配img標(biāo)簽上的src和alt
$img_preg = '/<img class="quic" _src="(.*)" src="(.*)" alt="(.*)" \/>/U';
//匹配電影的url
$video_preg='/<a href="(.*)" rel="external nofollow"  title="(.*)" target="(.*)"><\/a>/U';
//把所有的li存到$list里,$list是個(gè)二維數(shù)組
preg_match_all($list_preg,$data,$list);
   //var_dump($list);
foreach ($list[0] as $k => $v) {   //這里$v就是每一個(gè)li標(biāo)簽
/* 獲取圖片及電影名稱
    preg_match($img_preg,$v,$img);  //把匹配到的圖片的信息存到$img里
    var_dump($img);
    */
    /*獲取電影地址
    preg_match($video_preg,$v,$video);  //把匹配到的電影的信息存到$video里
    var_dump($video);
*/
    preg_match($img_preg,$v,$img);
    preg_match($video_preg,$v,$video);
    echo $img[0].'<a href="'.$video[1].'" rel="external nofollow" >'.$video[2].'</a>';
}

????測(cè)試:

????打印$list;

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖8

????打印$img

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖9

????打印$video

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖10

????最終效果:

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖11

????如果需要把圖片拷貝到硬盤上,則在foreach循環(huán)里加上以下代碼:

 $imgData = get($img[1]);
    // 把圖片文件寫到硬盤上【下載】
    // 因?yàn)椴僮飨到y(tǒng)是GBK的,所以要把UTF8轉(zhuǎn)成GBK
    is_dir('./youkuimg/') ? '': mkdir('./youkuimg/');
	file_put_contents('./youkuimg/'.mb_convert_encoding($img[3], 'gbk', 'utf-8').'.jpg', $imgData);
PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖12

????效果如下:在當(dāng)前目錄下的youkuimg目錄下就會(huì)有下載好的圖片。

PHP如何實(shí)現(xiàn)數(shù)據(jù)采集?數(shù)據(jù)采集方法插圖13
0 條回復(fù) A文章作者 M管理員
    暫無(wú)討論,說(shuō)說(shuō)你的看法吧
QQ客服
  • QQ176363189 點(diǎn)擊這里給我發(fā)消息
旺旺客服
  • 速度網(wǎng)絡(luò)服務(wù)商 點(diǎn)這里給我發(fā)消息
電子郵箱
  • sudu@yunjiasu.cc
微信客服
  • suduwangluo