PHP制作百度词典查词采集器

百度dict 采集样本

写的采集百度dict词典翻译后的所有结果数据,当然附带了13.5w单词库和采集简单的案例,这里我把写出的主要类dict.class.php放出来,项目地址http://github.com/widuu/baidu_dict,有需要的直接fork就可以了~么么哒,这东西用的人很少,所以有用的兄弟拿走了哈~

header("content-type:text/html;charset=utf8");
class Dict{

private $word;

//显示的条数
private static $num = 10;

public function __construct(){}


/**
  • 公用返回百度采集数据的方法
  • @param string 英文单词
  • retun array(
    •          symbol" => 音标
    • "pro" => 发音
    • "example"=> 例句
    • "explain"=> 简明释义
    • "synonym"=> 同反义词
    • "phrase" => 短语数组
    • )
  • */
    public function content($word){
    $this -> word = $word;
    $symbol = $this -> Pronounced();
    $pro = $this->getSay();
    $example = $this -> getExample();
    $explain = $this -> getExplain();
    $synonym = $this -> getSynonym();
    $phrase = $this -> getPhrase();
    $result = array(
    "symbol" => $symbol,//音标
    "pro" => $pro,//发音
    "example"=> $example,//例句
    "explain"=> $explain,//简明释义
    "synonym"=> $synonym,//同反义词
    "phrase" => $phrase //短语数组
    );
    return $result;
    }

/**
  • 远程获取百度翻译内容
  • get function curl
  • retun string
  • */

private function getContent(){
    $useragent = "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0";
    $ch = curl_init();
    $url = "http://dict.baidu.com/s?wd=".$this->word;
    curl_setopt($ch,CURLOPT_URL,$url);
    curl_setopt($ch,CURLOPT_USERAGENT,$useragent);
    curl_setopt($ch,CURLOPT_RETURNTRANSFER,TRUE); 
    curl_setopt($ch,CURLOPT_FOLLOWLOCATION,1); 
    curl_setopt($ch,CURLOPT_HTTPGET,1);
    curl_setopt($ch,CURLOPT_AUTOREFERER,CURLOPT_HEADER,0); 
    curl_setopt($ch,CURLOPT_TIMEOUT,30);
    $result = curl_exec($ch);
    if (curl_errno($curl)) {
        echo 'Errno'.curl_error($curl);
    }
    curl_close($ch);
    return $result;
}


/**
  • 获取百度翻译发音
  • retun array(英,美)
  • */

private function Pronounced(){
    $data = $this -> getContent();
    preg_match_all("/\"EN\-US\"\>(.*)\<\/b\>/Ui",$data,$pronounced);
    return array(
        'en' => $pronounced[1][0],'us' => $pronounced[1][1]
    );
}

/**
 * 获取百度翻译发音
 * return array(英,美)
 *
 */

private function getSay(){
    $data = $this -> getContent();
    preg_match_all("/url=\"(.*)\"/Ui",'us' => $pronounced[1][1]
    );  
}

/**
  • 获取百度翻译例句
  • return array() 多维数组 例句
  • */

private function getExample(){
    $str = "";
    $data = $this -> getContent();
    preg_match_all("/var example_data = (.*)\]\;/Us",$example);
  $data1 = "[[[".ltrim($example[1][0],"[");
  $data2 = explode("[[[",$data1);
  $num = count(array_filter($data2));
    foreach($data2 as $key => $value){
        $data3 = explode("[[","[[".$value);
        foreach ($data3 as $k => $v) {
            preg_match_all("/\[\"(.*)\",/Us","[".$v,$match);
            if(!empty($match[1])){
                $str .= implode($match[1]," ")."@";
            }
        }
    }
    $data4 = trim($str,"@");
    $data5 = explode("@",$data4);
    $result = array_chunk($data5,2);
    return $result;
}

/**
  • 获取简明释义
  • return array (x => "词性",b => "附属")
  • **/

private function getExplain(){
    $data = $this -> getContent();
    preg_match_all("/id\=\"en\-simple\-means\"\>(.*)\<div(\s+)class\=\"source\"\>/Us",$explain);
    $r_data = $explain[1][0];
    preg_match_all("/\<p\>\<h3\>(?P<adj>.*)\<\/h3\>\<span\>(?P<name>.*)\<\/span\>\<\/p\>/Us",$r_data,$a_data);
    preg_match_all("/\<span\>(?P<tag>[^\>]+)\:\<a(\s+)href\=\"(.*)\"\>(?P<word>.*)\<\/a\>\<\/span\>/Us",$b_data);

    $result = array();
    foreach ($a_data["adj"] as $key => $value) {
        $result[$value] = $a_data["name"][$key];
    }

    $word_b = array();
    foreach ($b_data["tag"] as $key => $value) {
        $word_b[$value] = strip_tags($b_data["word"][$key]);
    }

    $result_data = array("x" => $result,"b" => $word_b);

    return $result_data;
}


/**
  • 获取同义词
  • return array(0 => "同义词",1 => "反义词") 一般为多维数组
  • */

private function getSynonym(){
    $data = $this -> getContent();
    preg_match_all("/id=\"en\-syn\-ant\"\>(.*)<div(\s+)class\=\"source\"&gt;/Us",$synonym);
    $content = $synonym[1][0];
    $data1 = explode("</dl>",$content);
    $result = array();
    $data2 = array();
    foreach ($data1 as $key => $value) {
        preg_match_all("/\<h3\>(?P<adj>.*)\&nbsp\;\<\/h3\>\<\/div\>\<div(\s+)class\=\"syn\-ant\-list\"\>\<ul\>(?<content>.*)\<\/ul\>/Us",$value,$r_data);
        $data2[$key]["adj"] = $r_data["adj"];
        $data2[$key]["content"] = $r_data["content"];
    }

    foreach ($data2 as $key => $value) {
        foreach ($value["content"] as $k => $v) {
            if(!empty($v)){
                preg_match_all("/\<li\>\<p\>(?P<title>.*)\<\/p\>(?P<value>.*)\<\/li>/Us",$v,$v_data);
                foreach ($v_data['title'] as $m => $d) {

$data = strip_tags(preg_replace("<>"," ",$v_data["value"][$m]));
$result[$key][$value["adj"][$k]][$d] = $data;
}
}
}
}
return $result;
}

/**
  • 获取短语词组
  • return array (key => value) 一维或者多维数组
  • */

private function getPhrase(){
    $num = self::$num;
    $data = $this -> getContent();
    preg_match_all("/id=\"en\-phrase\"\>(.*)\<div class\=\"source\"\>/Us",$phrase);
    $data = explode("</dd>",$phrase[1][0]);
    $data1 = array_slice($data,$num);
    $result = array();
    foreach ($data1 as $key => $value) {
        $data2 = explode("</p>",$value);
        $n = count($data2);
        if($n<=3){
            $result[str_replace("","",strip_tags($data2[0]))] = strip_tags($data2[1]);
        }else{
            $data3 = array_slice($data2,$n-1);
            $data4 = array_slice($data2,2);
            $res = array_diff($data3,$data4);
            $data5 = array_chunk($res,2);
            $key_value = trim(str_replace("",strip_tags($data4[0])));
            $result[$key_value] = strip_tags($data4[1]);
            foreach ($data5 as $key => $value) {
                foreach ($value as $k => $v) {

$value[$k] = strip_tags($v);
}
$array = array($result[$key_value],$value);
if (array_key_exists($key_value,$result)){
$result[$key_value] = $array;
}
}

        }
    }
    return $result;
}

/**
 * 将数组转换为字符串
 *
 * @param  array  $data    数组
 * @param  bool  $isformdata 如果为0,则不使用new_stripslashes处理,可选参数,默认为1
 * @return  string 返回字符串,如果,data为空,则返回空
 */
private function array2string($data,$isformdata = 1) {
  if($data == '') return '';
  if($isformdata) $data = $this->new_stripslashes($data);
  return addslashes(var_export($data,TRUE));
}

/**
 * 返回经stripslashes处理过的字符串或数组
 * @param $string 需要处理的字符串或数组
 * @return mixed
 */
private function new_stripslashes($string) {
  if(!is_array($string)) return stripslashes($string);
  foreach($string as $key => $val) $string[$key] = $this->new_stripslashes($val);
  return $string;
}

}

// $word = new dict("express");
// $word ->content();

以上就是本文的全部内容了,非常实用的功能,希望小伙伴们能够喜欢。

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。

相关推荐


文章浏览阅读8.4k次,点赞8次,收藏7次。SourceCodester Online Tours & Travels Management System pay.php sql injectionLine 16 of pay.php invokes a SQL query built using unvalidated input. This call could allow an attacker to modify the statement’s meaning or to execute arbitrary SQL commands.SQL
文章浏览阅读3.4k次,点赞46次,收藏51次。本文为大家介绍在windwos系统搭建typecho博客+cpolar内网穿透工具将博客发布到公共网络环境,实现远程也可以访问和操作。_windows搭建typecho
文章浏览阅读1.1k次。- php是最优秀, 最原生的模板语言, 替代语法,让php更加的优雅的与html生活在一起 -->请放心, 最终生成的,或者说用户最终看到的,仍然是一个html文档, php代码中的内容不会被泄漏的。-- 将php与html代码混编的时候,大括号很容易造成配对错误,最好杜绝它 -->php标签内部代码由php.exe解释, php标签之外的代码原样输出,仍由web服务器解析。-- 所以php的流程控制语句, 都提供了替代语法,用冒号代替大括号 -->php echo '百变鹏仔'?_利用php将静态页面修改为动态页面
文章浏览阅读1.1k次,点赞18次,收藏15次。整理K8s网络相关笔记博文内容涉及 Linux network namespace 认知以及彼此通信Demo,实际中的应用理解不足小伙伴帮忙指正不必太纠结于当下,也不必太忧虑未来,当你经历过一些事情的时候,眼前的风景已经和从前不一样了。——村上春树。_linux network namespace 多端通信 模式认知
文章浏览阅读1.2k次,点赞22次,收藏19次。此网络模型提供了一个逻辑二层(L2)网络,该网络封装在跨 Kubernetes 集群节点的现有三层(L3)网络拓扑上。使用此模型,可以为容器提供一个隔离的 L2 网络,而无需分发路由。封装网络带来了少量的处理开销以及由于覆盖封装生成 IP header 造成的 IP 包大小增加。封装信息由 Kubernetes worker 之间的 UDP 端口分发,交换如何访问 MAC 地址的网络控制平面信息。此类网络模型中常用的封装是 VXLAN、Internet 协议安全性 (IPSec) 和 IP-in-IP。_k8s网络组件对比
文章浏览阅读1.1k次,点赞14次,收藏19次。当我们谈论网络安全时,我们正在讨论的是保护我们的在线空间,这是我们所有人的共享责任。网络安全涉及保护我们的信息,防止被未经授权的人访问、披露、破坏或修改。
文章浏览阅读1.3w次,点赞3次,收藏7次。尽管您可以通过 ping 命令解析出网站的 IP 地址,但是可能在浏览器中访问时仍然遇到问题,这可能是因为浏览器使用的 DNS 解析结果不同于 ping 命令使用的解析结果。可能是因为您的网络或设备上设置了防火墙,阻止了对特定网站的访问。有些国家或组织可能会对特定的域名进行屏蔽,从而阻止访问相关网站。如果您的网络使用代理服务器进行访问控制,可能会由于代理服务器的配置问题导致无法访问某些网站。即使您的网络和设备一切正常,目标网站本身可能也存在问题,例如服务器故障、维护或过载,导致无法访问。_能ping通打不开网页
文章浏览阅读839次,点赞22次,收藏19次。本系统带文档lw万字以上文末可领取本课题的JAVA源码参考。
文章浏览阅读2.1k次,点赞31次,收藏22次。基于微信小程序奶茶点餐外卖系统设计与实现(PHP后台+Mysql)可行性分析毕设源代码毕业设计,数据安全和系统稳定性以及团队能力和资源配备方面都具备较好的条件。因此,该项目的可行性较高。:黄菊华老师《Vue.js入门与商城开发实战》《微信小程序商城开发》图书作者,CSDN博客专家,在线教育专家,CSDN钻石讲师;微信小程序作为一种快捷、方便的移动应用形式,成为很多用户点餐外卖的首选。项目的界面和功能都可以定制,包安装运行!项目配有对应开发文档、开题报告、任务书、PPT、论文模版等。
文章浏览阅读1.8k次,点赞52次,收藏38次。本文主要通过对系统的前台系统和后台管理系统进行了功能性需求分析,对系统的安全性和可扩展性进行了非功能性需求分析。在详细的需求分析的基础上,根据系统的功能设计确定了数据库结构,实现完整的代码编写。Lucky+Baby母婴用品网站使用 Dreamweaver、HBuilder代码编辑器、Apache服务器等开发工具,完成了系统的主要模块的页面设计和功能实现。本文展示了首页页面的实现效果图,并通过代码和页面介绍了用户注册功能、商品搜索功能、生成订单和查看我的订单功能、在线付款功能功能的实现过程。
文章浏览阅读1.5k次,点赞45次,收藏40次。本设计主要实现集人性化、高效率、便捷等优点于一身的人事信息管理系统,完成首页、系统用户、通知公告、部门信息、员工薪资、考勤签到、员工请假、招聘信息、应聘信息等功能模块。
文章浏览阅读1k次。该错误通常出现在数据库读取结果集数据时,比如当我们写好SQL语句从数据库读取数据时,本身应该返回结果集,再给结果集中读取数据。解决思路:这种错误一般是因为echo后面输出了一个数组导致的,或者是数组作为字符串进行拼接运算时导致的。该错误直译为:警告:mysqli_fetch_assoc函数期望参数1是mysqli的结果集,但是给了一个布尔值。这种错误是PHP解析器在解析时遇到了语法错误,直译为:解析错误:语法错误,意料之外的...该错误直译为:提示:未定义的索引:username。_array to string conversion in
文章浏览阅读2.7w次。解决http请求报错context deadline exceeded (Client.Timeout exceeded while awaiting headers)_context deadline exceeded (client.timeout exceeded while awaiting headers)
文章浏览阅读1.3k次,点赞26次,收藏24次。复杂网络是一种由大量相互连接的元素(节点或顶点)组成的网络结构,这些连接通常是非常复杂和动态的。这些网络可以在各种领域中发现,包括社交网络、生物学系统、信息技术和交通系统等。_代理建模
文章浏览阅读2.6k次,点赞76次,收藏71次。epoll详解,事件模型,ET/LT模式,并通过三个示例进行代码实现。
文章浏览阅读3.3k次。罗拉ROLA-IP是一家来自纽约的代理IP提供商,由李嘉诚先生投资建设,韩国人工智能、自动驾驶、虚拟现实方面的领军企业World IT Show投资入股,由美国纽约大学IT管理教授团队研究开发,进入中国市场6年多,全世界设有多个分子公司。接下来,我们要检查代理和防火墙的设置,因为在绝大多数情况下,它们是导致这个错误的原因,尤其是当用户使用免费代理时。对网站的访问受阻实际上是一个非常常见的错误,它既可能是由于物理原因(硬件问题)造成的,也可能是由于软件错误引起的。检查代理设置,并确保其正确配置。_无法访问此网站,检查代理服务器和防火墙
文章浏览阅读1.1k次,点赞14次,收藏20次。本系统带文档lw万字以上文末可领取本课题的JAVA源码参考。_php洗车服务预约管理系统php源码
文章浏览阅读1.1k次。桶排序是计数排序的升级版。它利用了函数的映射关系,高效与否的关键就在于这个映射函数的确定。同时,对于桶中元素的排序,选择何种比较排序算法对于性能的影响至关重要。
文章浏览阅读936次,点赞22次,收藏17次。本系统带文档lw万字以上文末可领取本课题的JAVA源码参考。
文章浏览阅读822次,点赞15次,收藏14次。在整个设计过程中,要确定可能的具体解决方案,以实现每一个小的最终目标,对于每一个小目标,我们首先必须了解一些相关的需求分析信息。除了以上作品下面是2023-2024年最新100套计算机专业原创的毕业设计源码+数据库,是近期作品,如果你的题目刚好在下面可以文末领取java源码参考。springboot基于springboot的在线考试系统。springboot基于springboot的商城购物系统。springboot基于微信小程序的智慧校园设计与实现。springboot基于用户的协同过滤算法的话题推荐。