从基因数据库到疾病关联检索:Human_Genes_Functions Stage 6C 的开发、纠错与部署实践

一、项目背景 Human_Genes_Functions 是一个面向人类基因信息检索的本地科研数据库项目。 项目的核心目标不是简单保存一份基因列表,而是建立一个可以持续扩展、能够追溯数据来源、支持命令行与网页查询、并且可以重复构建和部署的本地知识系统。 项目基础数据主要包括: 项目采用 SQLite 作为主要数据库载体,并逐步建立了全文检索、基因详情查询、疾病本体查询、双向基因—疾病关系查询以及网页端展示能力。 二、系统架构与主机职责 整个项目运行在三台职责不同的主机上。为避免暴露真实环境,以下使用脱敏名称: 1. 开发主机 开发主机保存项目的正式 Git 仓库,例如: 所有正式开发工作均应在此完成,包括: 开发主机是项目的唯一正式开发源。 2. AI 代理主机 AI 代理主机运行自动化代理和任务调度系统。 该主机可以: 但它不应保存正式项目副本,也不应在自己的空项目目录中生成 Human_Genes_Functions 文件。 3. Web 部署主机 部署主机运行 Apache、PHP 和正式 Web 应用。 正式网站目录采用类似结构: 其中: 部署主机只作为运行环境,不作为主要开发位置。 三、Stage 6A:建立 Mondo 疾病本体层 在 Stage 6A 中,项目加入了 Mondo 疾病本体数据。 这一阶段的目标是建立统一的疾病标识层,使疾病可以通过以下形式被识别: 疾病本体层为后续 ClinVar …

从人类基因数据处理到 Web UI 上线:一个生物信息系统 Stage 1 的完整工程闭环

一个生物信息项目从“数据下载完成”到“真正可以访问”,中间隔着很长一段工程距离。 原始数据需要清洗、映射、索引、校验;查询逻辑需要从命令行走向可复用服务;服务器部署需要处理路径、权限和安全边界;Web UI 需要在不暴露原始数据库和序列文件的前提下,把复杂数据变成可以浏览、搜索和理解的信息页面。 Human_Genes_Functions 的 Stage 1,就是这样一个从数据工程到在线查询系统的初始闭环。它不是最终豪华版平台,但已经完成了一个很重要的阶段:从本地人类基因功能数据库,推进到可通过浏览器访问的 Web UI,并且通过了功能、安全、截图和文档归档验收。 一、项目目标:不是一个网页,而是一套人类基因知识底座 Human_Genes_Functions 的目标不是简单做一个基因搜索框,也不是把几个文件放到服务器上供下载。它更接近一个长期演进的人类基因功能信息系统。 Stage 1 的目标可以拆成两层。 第一层是数据底座: 第二层是 Web 入口: 这两个层次的关系非常重要: 数据库和 FASTA 是系统底座,Web UI 只是受控查询层。浏览器看到的是查询结果,不是原始数据文件。 二、数据基线:以 GRCh38.p14 与 GENCODE Release 50 为核心 项目的数据基线采用 GRCh38.p14 和 GENCODE Release 50。这个选择决定了后续所有基因、转录本、外显子、CDS、蛋白关系和坐标体系的基础。 GENCODE 层提供的是整个系统的主骨架: 这些信息进入 SQLite 后,构成最基础的结构表: 从数量上看,这不是一个玩具数据库。系统中整理了约 78,733 个基因、644,292 条转录本、5,078,384 条外显子记录和 3,210,731 …