程式師世界 >> 編程語言 >> 網頁編程 >> PHP編程 >> 關於PHP編程 >> PHP改進計算字符串相似度的函數similar_text()、levenshtein()，levenshtein

PHP改進計算字符串相似度的函數similar_text()、levenshtein()，levenshtein

編輯：關於PHP編程

PHP改進計算字符串相似度的函數similar_text()、levenshtein()，levenshtein

similar_text()中文漢字版

復制代碼代碼如下:
     <?php
     //拆分字符串
     function split_str($str) {
       preg_match_all("/./u", $str, $arr);
       return $arr[0];
     }

     //相似度檢測
     function similar_text_cn($str1, $str2) {
       $arr_1 = array_unique(split_str($str1));
       $arr_2 = array_unique(split_str($str2));
       $similarity = count($arr_2) - count(array_diff($arr_2, $arr_1));

       return $similarity;
     }

levenshtein()中文漢字版

復制代碼代碼如下:
     <?php
     //拆分字符串
     function mbStringToArray($string, $encoding = 'UTF-8') {
         $arrayResult = array();
         while ($iLen = mb_strlen($string, $encoding)) {
             array_push($arrayResult, mb_substr($string, 0, 1, $encoding));
             $string = mb_substr($string, 1, $iLen, $encoding);
         }
         return $arrayResult;
     }
     //編輯距離
     function levenshtein_cn($str1, $str2, $costReplace = 1, $encoding = 'UTF-8') {
         $count_same_letter = 0;
         $d = array();
         $mb_len1 = mb_strlen($str1, $encoding);
         $mb_len2 = mb_strlen($str2, $encoding);
         $mb_str1 = mbStringToArray($str1, $encoding);
         $mb_str2 = mbStringToArray($str2, $encoding);
         for ($i1 = 0; $i1 <= $mb_len1; $i1++) {
             $d[$i1] = array();
             $d[$i1][0] = $i1;
         }
         for ($i2 = 0; $i2 <= $mb_len2; $i2++) {
             $d[0][$i2] = $i2;
         }
         for ($i1 = 1; $i1 <= $mb_len1; $i1++) {
             for ($i2 = 1; $i2 <= $mb_len2; $i2++) {
                 // $cost = ($str1[$i1 - 1] == $str2[$i2 - 1]) ? 0 : 1;
                 if ($mb_str1[$i1 - 1] === $mb_str2[$i2 - 1]) {
                     $cost = 0;
                     $count_same_letter++;
                 } else {
                     $cost = $costReplace; //替換
                 }
                 $d[$i1][$i2] = min($d[$i1 - 1][$i2] + 1, //插入
                 $d[$i1][$i2 - 1] + 1, //刪除
                 $d[$i1 - 1][$i2 - 1] + $cost);
             }
         }
         return $d[$mb_len1][$mb_len2];
         //return array('distance' => $d[$mb_len1][$mb_len2], 'count_same_letter' => $count_same_letter);
     }

最長公共子序列LCS()

復制代碼代碼如下:
         <?php
         //最長公共子序列英文版
         function LCS_en($str_1, $str_2) {
           $len_1 = strlen($str_1);
           $len_2 = strlen($str_2);
           $len = $len_1 > $len_2 ? $len_1 : $len_2;
           $dp = array();
           for ($i = 0; $i <= $len; $i++) {
             $dp[$i] = array();
             $dp[$i][0] = 0;
             $dp[0][$i] = 0;
           }
           for ($i = 1; $i <= $len_1; $i++) {
             for ($j = 1; $j <= $len_2; $j++) {
               if ($str_1[$i - 1] == $str_2[$j - 1]) {
                 $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1;
               } else {
                 $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1];
               }
             }
           }
           return $dp[$len_1][$len_2];
         }
         //拆分字符串
         function mbStringToArray($string, $encoding = 'UTF-8') {
           $arrayResult = array();
           while ($iLen = mb_strlen($string, $encoding)) {
             array_push($arrayResult, mb_substr($string, 0, 1, $encoding));
             $string = mb_substr($string, 1, $iLen, $encoding);
           }
           return $arrayResult;
         }
         //最長公共子序列中文版
         function LCS_cn($str1, $str2, $encoding = 'UTF-8') {
           $mb_len1 = mb_strlen($str1, $encoding);
           $mb_len2 = mb_strlen($str2, $encoding);
           $mb_str1 = mbStringToArray($str1, $encoding);
           $mb_str2 = mbStringToArray($str2, $encoding);
           $len = $mb_len1 > $mb_len2 ? $mb_len1 : $mb_len2;
           $dp = array();
           for ($i = 0; $i <= $len; $i++) {
             $dp[$i] = array();
             $dp[$i][0] = 0;
             $dp[0][$i] = 0;
           }
           for ($i = 1; $i <= $mb_len1; $i++) {
             for ($j = 1; $j <= $mb_len2; $j++) {
               if ($mb_str1[$i - 1] == $mb_str2[$j - 1]) {
                 $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1;
               } else {
                 $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1];
               }
             }
           }
           return $dp[$mb_len1][$mb_len2];
         }

(100分)[php]寫幾個你熟悉的字符串處理函數!

addcslashes addslashes bin2hex chop chr chunk_split convert_cyr_string cyrillic
convert_uudecode convert_uuencode count_chars crc32 crc32 crypt echo explode

fprintf get_html_translation_table hebrev

hebrevc
hex2bin — Decodes a hexadecimally encoded binary string
html_entity_decode — Convert all HTML entities to their applicable characters
htmlentities — Convert all applicable characters to HTML entities
htmlspecialchars_decode — Convert special HTML entities back to characters
htmlspecialchars — Convert special characters to HTML entities
implode — Join array elements with a string
join

lcfirst — Make a string's first character lowercase
levenshtein — Calculate Levenshtein distance between two strings
localeconv — Get numeric formatting information
ltrim — Strip whitespace (or other characters) from the beginning of a string
md5_file
metaphone — Calculate the metaphone key of a string
money_format — Formats a number as a currency string
nl_langinfo — Query language and locale information
nl2br

number_format — Format a number with grouped thousands
ord

parse_str

print

printf

quoted_printable_decode — Convert a quoted-printable string to an 8 bit string
quoted_printable_encode — Convert a 8 bit string to a quoted-printable string
quotemeta — Quote meta characters
rtrim
setlocale — Set locale information
sha1_file

sha1

soundex — Calculate the soundex key of a string
sprintf — Return a formatted string
sscanf — Parses input from a string according to a ......余下全文>>

對於php的levenshtein函數可以否給個通俗易懂的解釋，手冊看不懂

W3School的解釋：
levenshtein() 函數返回兩個字符串之間的 Levenshtein 距離。
Levenshtein 距離，又稱編輯距離，指的是兩個字符串之間，由一個轉換成另一個所需的最少編輯操作次數。許可的編輯操作包括將一個字符替換成另一個字符，插入一個字符，刪除一個字符。
例如把 kitten 轉換為 sitting：
sitten （k→s）
sittin （e→i）
sitting （→g）
levenshtein() 函數給每個操作（替換、插入和刪除）相同的權重。不過，您可以通過設置可選的 insert、replace、delete 參數，來定義每個操作的代價。

說明：“代價”就是權重。樓主的例子中，Hello World→ello World，需要“刪除”“H”，也就是采用了第五個參數，對應的權重是30，所以返回30.