基于数据集成的基因调控网络构建

计 算 机 工 程 第 38 卷 第22期

Computer Engineering V ol.38 No.22

文章编号:文章编号:1000—3428(2012)22—0263—04 ·开发研究与设计技术·开发研究与设计技术·

2012年11月

November 2012

文献标识码:文献标识码:A

中图分类号:中图分类号:TP393

基于数据集成基于数据集成的集成的基因调控网络构建基因调控网络构建

李晓华,李晓华,邓 伟

(苏州大学计算机科学与技术学院,苏州 215006)

摘 要:原有数据集成方法在基因调控网络构建中不能很好地利用数据之间的相关特性。为此,提出一种改进的数据集成方法。分别利用敲除数据和微扰数据进行预测,根据2种实验数据预测结果的重叠程度赋予不同的可信度,优先考虑重叠程度高的部分,按照可信度对预测结果进行排序。采用Dream3数据集与原有方法进行性能对比,实验结果表明,改进方法的总体性能比原有方法高出4.9%。 关键词:关键词:基因调控;数据集成;敲除数据;微扰数据;噪声模型;微分方程

Construction of Gene Regulatory Network

Based on Data Integration

LI Xiao-hua, DENG Wei

(School of Computer Science & Technology, Soochow University, Suzhou 215006, China)

【Abstract】An improved data integration method is proposed, in order to solve the problem of inadequate use of data-related characteristics in the procedure of constructing gene regulatory networks based on data integration. It uses knockout data and perturbation data to make predictions respectively, gives different confidence to the predictions of the two experimental data according to their overlap degree, and priority to the part with higher overlap degree. It sorts the predictions in accordance with their confidence. To assess the performance of the two methods, Dream3(Dialogue for Reverse Engineering Assessments and Methods) datasets are used. Experimental results show that the overallscore of the improved method is 4.9% higher than the existing method.

【Key words】gene regulation; data integration; knockout data; perturbation data; noise model; differential equation DOI: 10.3969/j.issn.1000-3428.2012.22.066

1 概述

基因之间的相互调控作用是影响基因表达的重要机制,生物体内基因之间调控关系的确定,对于确定复杂疾病的发病机制和进一步研制新药物治疗基因疾病至关重要[1],通过构建基因调控网络,可以系统地研究生物体细胞内多个基因之间的调控关系,解读复杂的调控作用,为深入挖掘细胞内复杂的作用机制提供必要途径。在调控网络建模方面,国内外已研究了很多数学方法,如加权矩阵模型的方法、贝叶斯网络的方法[2]以及基于互信息的方 法[3]等。

由于技术和成本的原因,基因芯片数据的数量远远小于相对庞大的基因数量,因此数据集成成为解决这个难题的必然选择。国际上在集成多种数据构建基因调控网络方面已取得了一些成果,如文献[5]将TFBS数据与基因表达数据进行集成,找到了因采用严格阈值而漏掉的调控关系,文献[6]则通过集成PPI(Protein-Protein Interaction)数据和基因表达时序数据,成功构建了基因调控网络。近年来,在数据集成的研究中,最有代表性的方法是文献[7]所采用的集成敲除和微扰数据的方法。

————————————

[4]

文献[7]方法根据所集成数据预测结果的互补特性对基因调控网络建模,虽然在一定程度上解决了单数据源提供的信息不够全面的问题,但没有考虑到2种数据的预测结果的交集更具可信度的特性,无法有效地降低假阳性率,从而影响了所构建的网络的覆盖率。

针对文献[7]数据集成方法对数据相关特性利用不足的缺陷,本文提出一种改进的数据集成方法,利用原有方法计算每种数据集的预测结果,充分利用敲除和微扰数据预测结果的互补特性,同时考虑2种集成数据预测结果的重叠程度越高越具可信度的特点,以降低假阳性率,提高所构建网络的覆盖率。

2 实验数据与集成方法实验数据与集成方法

2.1 数据集的组成

本文实验数据来源于Dream3(Dialogue for Reverse Engineering Assessments and Methods)[8-9],选取其中含 10个基因的子网络的表达数据进行实验,即基准数据集Ecoli1、Ecoli2、Yeast1、Yeast2和Yeast3。每个基准数据杂合子敲除数集包括完全敲除数据(Null-mutants dataset),

据(Heterozygous dataset)和微扰数据(Perturbation dataset)。

作者简介:作者简介:李晓华(1986-),女,硕士研究生,主研方向:神经网络,生物信息学;邓 伟,副教授、博士 收稿日期:收稿日期:2012-02-06 修回日期:修回日期:2012-03-05 E-mail:dengw@suda.edu.cn

基于数据集成的基因调控网络构建相关文档

最新文档

返回顶部