论文首页哲学论文经济论文法学论文教育论文文学论文历史论文理学论文工学论文医学论文管理论文艺术论文 |
摘要:在生物信息学系统设计中引进推荐系统,提出具有个性化服务的生物信息学网站模型,完成生物信息学推荐系统的设计和实现,体现出推荐系统在生物信息学中使用的必要性和优越性。
关键词:推荐系统;生物信息学
推荐系统(Recommender System) [1]是个性化信息服务的主要技术之1,它实现的是“信息找人,按需服务”;通过对用户信息需要、兴趣爱好和访问历史等的收集分析,建立用户模型,并将用户模型应用于网上信息的过滤和排序,从而为用户提供感兴趣的资源和信息。生物信息学(Bioinformatics)[2,3]是由生物学、应用数学和计算机科学相互交叉所形成的1门新型学科;其实质是利用信息科学的方法和技术来解决生物学问题。20世纪末生物信息学迅速发展,在信息的数量和质量上都极大地丰富了生物科学的数据资源,而数据资源的急剧膨胀需要寻求1种科学而有力的工具来组织它们,基于生物信息学的2次数据库[4]能比较好地规范生物数据的分类与组织,但是用户无法从大量的生物数据中寻求自己感兴趣的部分(著名的生物信息学网站NCBI(美国国立生物技术信息中心),仅仅是小孢子虫(Microsporidia)的DNA序列就达3 399种),因此在生物2次数据库上建立个性化推荐系统,能使用户快速找到自己感兴趣的生物信息。特别是在当前生物信息数据量急剧增长的情况下,生物信息学推荐系统将发挥强大的优势。
1推荐系统的工作流程
应用在不同领域的推荐系统,其体系结构也不完全相同。1般而言,推荐系统的工作流程[5]如图1所示。
(1)信息获取。推荐系统工作的基础是用户信息。用户信息包括用户输入的关键词、项目的有关属性、用户对项目的文本评价或等级评价及用户的行为特征等,所有这些信息均可以作为形成推荐的依据。信息获取有两种类型[6],即显式获取(Explicit)和隐式获取(Implicit),由于用户的很多行为都能暗示用户的喜好,因此隐式获取信息的准确性比显式高1些。 (转载自http://zw.nseac.coM科教作文网)
(2)信息处理。信息获取阶段所获得的用户信息,1般根据推荐技术的不同对信息进行相应的处理。用户信息的存储格式中用得最多的是基于数值的矩阵格式,最常用的是用m×n维的用户—项目矩阵R来表示,矩阵中的每个元素R﹊j=第i个用户对第j个项目的评价,可以当做数值处理,矩阵R被称为用户—项目矩阵。
(3)个性化推荐。根据形成推荐的方法的不同可以分为3种,即基于规则的系统、基于内容过滤的系统和协同过滤系统。基于规则的推荐系统和基于内容过滤的推荐系统均只能为用户推荐过去喜欢的项目和相似的项目,并不能推荐用户潜在感兴趣的项目。而协同过滤系统能推荐出用户近邻所喜欢的项目,通过用户与近邻之间的“交流”,发现用户潜在的兴趣。因此本文所用的算法是基于协同过滤的推荐算法。
(4)推荐结果。显示的任务是把推荐算法生成的推荐显示给用户,完成对用户的推荐。目前最常用的推荐可视化方法是Top-N列表[7],按照从大到小顺序把推荐分值最高的玁个事物或者最权威的玁条评价以列表的形式显示给用户。
2生物信息学推荐系统的设计
综合各种推荐技术的性能与优缺点,本文构造的生物信息学推荐系统的总体结构如图2所示。
生物信息学推荐系统实现的主要功能是在用户登录生物信息学网站时,所留下的登录信息通过网站传递到推荐算法部分;推荐算法根据该用户的用户名从数据库提取出推荐列表,并返回到网站的用户界面;用户访问的记录返回到数据库,系统定时调用推荐算法,对数据库中用户访问信息的数据进行分析计算,形成推荐列表。
本系统采用基于近邻的协同过滤推荐算法,其结构可以进1步细化为如图3所示。算法分为邻居形成和推荐形成两大部分,两部分可以独立进行。这是该推荐系统有别于其他系统的优势之1。由于信息获取后的用户—项目矩阵维数较大,使得系统的可扩展性降低。本系统采用SVD矩阵降维方法,减少用户—项目矩阵的维数,在计算用户相似度时大大降低了运算的次数,提高了推荐算法的效率。
推荐算法完成整个个性化推荐的任务,用Java实现。
(1)数据连接类DataCon。该类完成与SQL Server 2000数据库的连接,在连接之前必须要下载3个与SQL Server连接相关的包,即msutil.jar、msbase.jar和mssqlserver.jar。
(2)数据操作类DataControl。该类负责推荐算法与数据库的数据交换,静态成员Con调用DataCon. getcon()获得数据库连接,然后对数据库进行各种操作。把所有方法编写成静态,便于推荐算法中不创建对象就可以直接调用。
(3)RecmmendSource与CurrentUserNeighbor。这两个类作为FCRecommand类的内部类,RecmmendSource用于保存当前用户的推荐列表,包括推荐项目号和推荐度;CurrentUserNeighbor用于保存邻居信息,包括邻居ID号、相似度及其访问信息。
[6]BREESE J S, HECKERMAN D,KADIE C.Emperical analysis of predictive algorithms for collaborative filtering:proceedings of the Fourteenth Conference on University in Artificial Intelligence[C]. Madison:WI,1998:43-52.
[7]SCHAFER J B, KONSTAN J,RIEDL J.Recommender systems in e-commerce:proceeding of the ACM Conference on Electronic Commerce[C].Pittsburgh:PA,1999:158-166.
[8]PRYOR M H. The effects of singular value decomposition on collaborative filtering[EB/OL].(1998).http://www.cs.dartmouth.edu/reports/TR98-338.pdf.
[9]SARWAR B, KARYPIS G, KONSTAN J,玡t al.獳nalysis of recommendation algorithms for e-commerce:proceedings of the 2nd ACM Conference on Electronic Commerce[C].Minneapolis:[s.n.],2000:158-167.
[10]SUN Tong,ANDR’E T.An implemented e-commerce shopping system which makes personal recommendations[EB/OL].(2001-10).