程式師世界 >> 編程語言 >> 網頁編程 >> PHP編程 >> PHP綜合 >> php 文章采集正則表達式代碼

php 文章采集正則表達式代碼

編輯：PHP綜合

PHP 文章采集代碼主要是應用了正則表達式。
//采集Html
function getwebcontent($url){
$ch = curl_init();
$timeout = 10;
curl_setopt($ch, CURLOPT_URL, $url);
curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
curl_setopt($ch, CURLOPT_CONNECTTIMEOUT, $timeout);
curl_setopt ($ch, CURLOPT_FOLLOWLOCATION, 1);
$contents = trim(curl_exec($ch));
curl_close($ch);
return $contents;
}

//獲得標題和url
$string =
getwebcontent('http://www.***.com/learn/zhunbeihuaiyun/jijibeiyun/2');
//正則匹配<li>獲取標題和地址
preg_match_all ("/<li><a href=\"\/learn\/article\/(.*)\">(.*)<\/a>/",$string, $out, PREG_SET_ORDER);
foreach($out as $key => $value){
$article['title'][] = $out[$key][2];
$article['link'][] = "http://www.***.com/learn/article/".$out[$key][1];
}
//根據url獲取文章內容
foreach($article['link'] as $key=>$value){
$content_Html = getwebcontent($article['link'][$key]);
preg_match("/<div id=pagenum_0(.*)>[\s|\S]*?<\/div>/",$content_Html,$matches);
$article[content][$key] = $matches[0];
}
//不轉碼還真不能保存成文件
foreach($article[title] as $key=>$value){
$article[title][$key] = iconv('utf-8', 'gbk', $value);//轉碼
}
//存入文件
$num = count($article['title']);
for($i=0; $i<$num; $i++){
file_put_contents("{$article[title][$i]}.txt", $article['content'][$i]);
}
?>

PHP綜合

PHP模板引擎Smarty內建函數section,sectionelse用法詳解

本文實例講述了PHP模板引擎Smarty內建函數sectio

Yii2 GridView實現列表頁直接修改數據的方法

什麼意思呢？我來簡單的描述下，小編妹子提的需求是這樣的，你看

PHP生成條形碼-開源之道

該軟件支持PHP4和PHP5兩個版本，本文中使用的是PHP

使用WordPress發送電子郵件的相關PHP函數用法解析

wp_mail() 函數用來發送郵件，類似於 PHP 的 m

PHP表單遞交控件名稱含有點號(.)會被轉化為下劃線(_)的處理方法

最近在做公司項目的時候，發現一個奇怪的問題，遞交一個正常表單

兩種php實現圖片上傳的方法

圖片上傳在項目中經常用到，幾乎沒有任何一個項目可以脫離圖片或