Categories


Tags


Google PageRank的计算源代码

最近对google的PageRank(网页等级)比较感兴趣,一直想知道如何不用google toolbar来获取pr值。苦苦搜索之后,找到如下代码:

<?php

/**

This code is released unto the public domain

*/

//header("Content-Type: text/plain; charset=utf-8");

define('GOOGLE_MAGIC', 0xE6359A60);

//unsigned shift right

function zeroFill($a, $b)

{

$z = hexdec(80000000);

if ($z & $a)

{

$a = ($a>>1);

$a &= (~$z);

$a |= 0x40000000;

$a = ($a>>($b-1));

}

else

{

$a = ($a>>$b);

}

return $a;

}

function mix($a,$b,$c) {

$a -= $b; $a -= $c; $a ^= (zeroFill($c,13));

$b -= $c; $b -= $a; $b ^= ($a<<8);

$c -= $a; $c -= $b; $c ^= (zeroFill($b,13));

$a -= $b; $a -= $c; $a ^= (zeroFill($c,12));

$b -= $c; $b -= $a; $b ^= ($a<<16);

$c -= $a; $c -= $b; $c ^= (zeroFill($b,5));

$a -= $b; $a -= $c; $a ^= (zeroFill($c,3));

$b -= $c; $b -= $a; $b ^= ($a<<10);

$c -= $a; $c -= $b; $c ^= (zeroFill($b,15));

return array($a,$b,$c);

}

function GoogleCH($url, $length=null, $init=GOOGLE_MAGIC) {

if(is_null($length)) {

$length = sizeof($url);

}

$a = $b = 0x9E3779B9;

$c = $init;

$k = 0;

$len = $length;

while($len >= 12) {

$a += ($url[$k+0] +($url[$k+1]<<8) +($url[$k+2]<<16) +($url[$k+3]<<24));

$b += ($url[$k+4] +($url[$k+5]<<8) +($url[$k+6]<<16) +($url[$k+7]<<24));

$c += ($url[$k+8] +($url[$k+9]<<8) +($url[$k+10]<<16)+($url[$k+11]<<24));

$mix = mix($a,$b,$c);

$a = $mix[0]; $b = $mix[1]; $c = $mix[2];

$k += 12;

$len -= 12;

}

$c += $length;

switch($len)              /* all the case statements fall through */

{

case 11: $c+=($url[$k+10]<<24);

case 10: $c+=($url[$k+9]<<16);

case 9 : $c+=($url[$k+8]<<8);

/* the first byte of c is reserved for the length */

case 8 : $b+=($url[$k+7]<<24);

case 7 : $b+=($url[$k+6]<<16);

case 6 : $b+=($url[$k+5]<<8);

case 5 : $b+=($url[$k+4]);

case 4 : $a+=($url[$k+3]<<24);

case 3 : $a+=($url[$k+2]<<16);

case 2 : $a+=($url[$k+1]<<8);

case 1 : $a+=($url[$k+0]);

/* case 0: nothing left to add */

}

$mix = mix($a,$b,$c);

/*-------------------------------------------- report the result */

return $mix[2];

}

//converts a string into an array of integers containing the numeric value of the char

function strord($string) {

for($i=0;$i<strlen($string);$i++) {

$result[$i] = ord($string{$i});

}

return $result;

}

// http://www.example.com/ - Checksum: 6540747202

$url = 'info:'.$_GET['url'];

$ch = GoogleCH(strord($url));

$url='info:'.urlencode($_GET['url']);

echo file_get_contents("http://www.google.com/search?client=navclient-auto&ch=6$ch&ie=UTF-8&oe=UTF-8&features=Rank&q=$url");

/* use curl send the user angent

$curl = curl_init("http://www.google.com/search?client=navclient-auto&ch=6$ch&ie=UTF-8&oe=UTF-8&features=Rank&q=$url");

curl_setopt ($curl, CURLOPT_USERAGENT, "Mozilla/4.0 (compatible; GoogleToolbar 2.0.110-big; Windows 2000 5.0)");

curl_exec($curl);

*/

?>

</></>

来源:月光博客


Public @ 2022-12-07 15:39:09

李彦宏超链分析和Google PR专利的区别

最早了解李彦宏超链分析专利是在洪波的博客中看到一篇文章:超链分析和PageRank的专利问题,才第一次知道百度总裁李彦宏曾经申请并获得对于超链接分析的专利,这份专利申请文件在美国专利局网站看到。李彦宏这个专利申请是在Google申请他们自己的PageRank专利之前的。由于这两份专利都是研究网页链接的,而且这两个专利的发明人是现在两大搜索引擎的创始人,所以很多人对这两个技术专利分不大清楚。甚至有的

Public @ 2012-05-15 15:39:01

Google的BERT算法更新

这篇帖子是去年(2019年)10月28号打的草稿,今天补充完成发出来。过去一年,关于搜索算法和SEO思维最大的新闻依然是这件事。2019年10月,Google公布上线BERT算法。什么是BERTBERT是Bidirectional Encoder Representations from Transformers的缩写,中文意思大概是“双向transformer编码器表达”,“transforme

Public @ 2018-08-23 15:54:59

Google PR劫持

Google PR劫持是一种黑客攻击方式,指的是攻击者通过某种手段修改了网站页面的PageRank值,以提高自己的站点排名或降低竞争对手的排名。具体来说,攻击者会通过篡改网站链接或利用重定向等方式,将莫名其妙的外链指向目标网站,从而提高目标网站的PR值。这种攻击对于网站所有者来说是极为危险的,因为它可能导致网站在搜索引擎结果中的排名受到影响,严重的甚至会被搜索引擎惩罚或封禁。为了避免这种情况发生,

Public @ 2023-06-27 00:50:12

Matt Cutts谈PR和PR更新

大家都注意到前两天Toolbar(工具条)PR已经更新了。Matt Cutts发了一个帖子,回答一些关于PR和PR更新的问题。问:我很好奇PR值在内部是怎样存储的?是小数,就像人们猜测的,还是整数?答:把它想为小数更准确。当然目前我们内部的PR计算比toolbar显示的0-10要长的多。问:我需要知道这个吗?我知道PR能告诉我什么,我为什么要在乎?也就是说对普通网站来说,PR有什么目的?答:我想这

Public @ 2012-12-27 15:39:04

更多您感兴趣的搜索