当前位置:主页 > 资源下载 > 35 > 指南[中文] - 学习目标：tinyxml

指南[中文] - 学习目标：tinyxml

更新：2024-05-22 12:03:50
大小：6.46MB
推荐：★★★★★
来源：网友上传分享
类别：算法与数据结构 - 大数据
格式：PDF

反馈 / 投诉

资源介绍

13.1 应用场景  舆情分析、企业竞争对手分析  互联网专业信息收集  　… 13.2 学习目标在学习完本章后，您应能够：  　解释什么是 web 挖掘、如何使用 web 挖掘，以及使用 web 挖掘有哪些好处。  　识别 web 挖掘可能采取的各种格式，以便进行 web 挖掘。  　连接至 web url，并将其导入为 web 挖掘模型的数据来源。  　在 RapidMiner 中开发一个 web 挖掘模型  　对 web 挖掘结果进行信息抽取、转储。 13.3 概览本章介绍 web 挖掘。由于大部分交流信息多数出现在互联网上，且以文本格式保存， web 挖掘是挖掘中的一个重要领域。我们将建立一个 RapidMiner 挖掘流程，来学习如何通过连接到生物医学期刊网站，获取蛋白质相关论文的 web 数据，从中找到用户关心的某些信息内容：某蛋白质近年来论文发表数量趋势，及该蛋白质论文的作者、联系邮箱、通讯地址等信息（对于蛋白质生产厂商，他一定关心如何找到这些信息进行广告投放）。我们会利用 web 挖掘技术、结合文本挖掘技术，把这些信息从互联网上获取存储到本地磁盘，然后利用 web 挖掘、文本挖掘技术对这些信息进行拆分解析，将有用信息存储到 mysql 数据库中。　以下为我们主要执行的挖掘步骤： – 安装 web 挖掘插件 – 加载网站 url 到 RapidMiner web 挖掘算子中 – 获取并保存 web 页面到本地磁盘

相关推荐

指南[中文] - 学习目标：tinyxml

资源介绍

热门标签

资源声明