PDA

Просмотр полной версии : проблема с eregi


4ert
19.10.2007, 17:13
Здравствуйте!
Есть задача: выдернуть все внешние ссылки с html страницы.
Зачем?: Допустим я хочу купить место под ссылку на морде какого-нить сайта. Но как узнать стоит ли оно того? для этого нужно проанализировать все внешние ссылки с этой морды на предмет их индексации в поисковиках.(это не кража контента, это анализ). Вот собственно для этого мне и надо получить все внешние ссылки.

Для получения этих ссылок я написал функцию:

function getrLinks($str,$ii,$site)
{
$i=0;
$str=strip_tags($str,'<a>');
while(eregi("(.*)(<a )([^>]*)(href=)([^ |^>]*)([^>]*)(>)(.*)(</a>)(.*)",$str,$ar))
{
$link=str_replace("'",'',$ar[5]);
$link=str_replace("\"",'',$link);
$text=$ar[8];
$repld=$ar[2].$ar[3].$ar[4].$ar[5].$ar[6].$ar[7].$ar[8].$ar[9];
$str=str_replace($repld,'',$str);
$text=strip_tags($text);
if($text and checkURL($link,$site))
{
//echo "<script>set_url_remote($ii);</script>\n";
//flush();
$links[$i]['link']=$link;
$links[$i]['text']=$text;
$i++;
}
unset($ar);
}
return $links;
}



Проблема в том,что если $str длинной реальной html страницы, то цикл нереально тормозит.. проходит одна-две секунды между итерациями.
Я что-то не так делаю?
А может есть более изящные способы решения этой задачи?
:eek:

uS
23.10.2007, 04:16
не самое красивое, но рабочее. Битые не пройдут, от параметров очищать нужно, либо условие добавит [^\?]
preg_match_all('!(?:\<\s*a\s*href\s*=\s*)([^<>]+)(?:\>[^<>]+<\/\s*a\s*\>)!', $subject, $result);
$result = $result[0];
цикл
дальше trim($result, '"\'')


могу больше и лучше