程式師世界 >> 編程語言 >> 網頁編程 >> PHP編程 >> 關於PHP編程 >> 獻給所有想學習正則和采集的朋友

獻給所有想學習正則和采集的朋友

編輯：關於PHP編程

<?php
function get_url_content($Url,$Method = c) {
    //引入需要的語言編碼.如果沒有, 就會默認為utf-8,不必擔心.
    global $Charset;
    $Urlarr = parse_url($Url);
    //如果檢測不出域名,就返回.
    if (!isset($Urlarr[host])) {
        return false;
    }
    //我們用智能方式定義header頭倍信息.
    foreach (@getallheaders() as $key => $val){
        $key===Host && $val = $Urlarr[host];
        $key===Referer && $val =http://.$Urlarr[host];
        $str .= "$key:$val, ";
    }
    //虛擬來路.
    !eregi(Referer,$str) && $str .="Referer:http://{$Urlarr[host]}, ";
    //經過修正, 基本上, 來路也是那個站, 主機也是Url站點.
    $Header = array(trim($str));
    //下面僅僅是選擇用哪個程序來采集.
    if($Method === f&&function_exists(file_get_contents)) {
    $opts = array(
          http=>array(
        method=>"GET",
        header=>$Header,
          )
    );
        $cxContext = stream_context_create($opts);
        $file_contents = @file_get_contents($Url, false, $cxContext);
    } elseif ($Method === c&&function_exists(curl_init)) {
    $Ch = curl_init();
    $Timeout = 5;
        curl_setopt($Ch,CURLOPT_HTTPHEADER,$Header);
        curl_setopt ($Ch, CURLOPT_URL, $Url);
        curl_setopt ($Ch, CURLOPT_RETURNTRANSFER,1);
        curl_setopt ($Ch, CURLOPT_CONNECTTIMEOUT, $Timeout);
    $file_contents = curl_exec($Ch);
    curl_close($Ch);
    }
    //為了讓樣式顯示得漂亮,我們給它加一句目標引向.
    $file_contents = str_replace(</title>,"</title> <base href="http://{$Urlarr[host]}/" />",$file_contents);
    //處理最常見的幾種編碼, 如果目標網站沒有編碼, 就默認為GBK
    !preg_match(/charset=([^<>"]*)"/isU,$file_contents,$lang) && $lang[1]=GBK;
    function_exists(mb_convert_encoding) && $file_contents = mb_convert_encoding($file_contents,empty($Charset)?UTF-8:$Charset,$lang[1]);
    //注銷部分代碼;
    unset($Url,$lang,$Timeout,$Urlarr,$Charset);
    return $file_contents;
    }

//測試開始測試用file_get_contents方式
HEADER("CONTENT-TYPE:TEXT/HTML; CHARSET=UTF-8");
//http://www.xtzj.com/read-htm-tid-347550.html 這是采集不到.
$file = get_url_content("http://www.hao123.com",f);
$file = strip_tags($file,<a>);
preg_match_all(/(http:[^"<>]*)>/isU,$file,$link);unset($link[0]);
$link = $link[1];