OpenScience 使用教程
OpenScience 是一个面向科研工作的开源 AI 工作台。它把文献检索、研究假设、代码编写、实验运行、数据分析、科研绘图和结果写作放在同一个浏览器工作区中,并提供 290 多个科研 Skills。
钱同学云服务器已经部署好 OpenScience。本教程介绍如何在 VNC 桌面中配置模型、启动工作台并开始第一个科研任务。
本文根据生信钱同学的 OpenScience 实战介绍整理。软件功能会持续更新,具体以 OpenScience 官方项目为准。
视频教程
第一次使用时,建议先观看完整实操视频。视频演示了单细胞基础分析、细胞通讯分析、Monocle2 拟时序分析、基因敲除分析、SCENIC 转录因子分析、细胞代谢分析,以及从单细胞转录组推断单细胞蛋白质组等任务。
OpenScience 能做什么?
OpenScience 不只是一个聊天窗口。你可以向它描述科研目标,让它在授权范围内协助完成连续工作流:
- 阅读论文和整理文献;
- 拆解科研问题并提出分析方案;
- 编写、运行和修改 Python、R、Shell 等代码;
- 调用科研数据库和专业工具;
- 检查分析结果并生成图表;
- 整理报告、论文初稿、幻灯片或海报。
它提供文件树、编辑器、终端、会话历史,以及分子、结构、基因组和图表的内联显示。内置 Skills 覆盖机器学习、生物医学、化学信息学、科研写作、可视化和云端算力等方向。
开始前的准备
开始使用前,请确认:
- 已经进入钱同学云服务器的 VNC 桌面;
- 已准备一个 OpenScience 支持的模型服务;
- 如果使用 API Key,已经从模型服务商的官方平台创建;
- 重要数据已有备份,并清楚哪些目录允许 AI 读取和修改。
本文以 DeepSeek API 为例。请从 DeepSeek 开放平台创建并管理自己的 Key。不要复制文章、截图或其他人的示例 Key。
第一步:打开 VNC 终端
登录服务器的 VNC 桌面后打开终端。OpenScience 会从当前终端继承环境变量,并在启动后自动打开浏览器工作区,因此下面的命令需要在 VNC 桌面环境中运行。
建议先进入本次分析使用的项目目录:
cd /你的项目目录不要直接在包含大量无关文件或敏感数据的上级目录中启动。
第二步:配置模型 API Key
在终端中设置自己的 DeepSeek API Key:
export DEEPSEEK_API_KEY="替换成你自己的_API_Key"这条命令只对当前终端会话生效。输入真实 Key 时请注意:
- 不要把 Key 写进教程、聊天记录、截图或公开代码仓库;
- 不要使用来源不明的 Key;
- 如果怀疑 Key 已泄露,应立即到服务商后台撤销并重新创建;
- 使用前检查账户余额、用量限制和计费规则。
OpenScience 也支持其他模型服务。不同服务商对应的环境变量和可用模型可能变化,请以官方文档及当前服务器配置为准。
第三步:启动 OpenScience
继续在同一个终端运行:
openscience按 Enter 执行后,OpenScience 会启动本地工作区并尝试自动打开浏览器。如果没有自动打开,请查看终端输出,在 VNC 浏览器中打开它提示的本地地址。
启动时不要关闭终端。终端中的 OpenScience 进程停止后,浏览器工作区也会失去连接。
第四步:确认工作区和模型
浏览器工作区打开后,先完成以下检查:
- 确认左侧文件树对应的是自己的项目目录;
- 在模型选择区域确认已经识别到希望使用的模型;
- 如果模型不可用,检查 API Key 名称、Key 是否有效以及账户额度;
- 先用一个小问题测试对话和文件读取,不要一开始就运行耗时任务。
如果需要切换模型,可在工作区的模型或凭据设置中选择其他已配置的服务。OpenScience 支持多模型,不必把所有任务固定到同一家模型服务。
第五步:提交第一个科研任务
一个可执行的科研任务应说明目标、数据、分析要求和输出。以单细胞数据为例:
请先只检查当前项目,不要修改或删除原始数据。
目标:分析 data/sample.h5ad 的主要细胞群。
要求:
1. 先汇报数据维度、元数据字段和质控指标;
2. 给出分析计划,等我确认后再运行;
3. 所有代码写入 scripts/,结果写入 results/;
4. 保留随机种子、软件版本和关键参数;
5. 不覆盖已有文件,不删除任何数据。建议先让 OpenScience 查看数据并给出计划,确认无误后再允许它运行代码。复杂任务可以分阶段推进,例如:
- 数据检查与质控;
- 降维、聚类和细胞注释;
- 细胞通讯或拟时序分析;
- 转录因子、代谢或基因扰动分析;
- 结果核验、绘图和报告整理。
内置科研 Skills
OpenScience 的 Skills 是针对特定任务准备的专业工作流程。常见方向包括:
| 方向 | 示例能力 |
|---|---|
| 机器学习 | 模型训练、PEFT、DeepSpeed、评估、实验记录 |
| 生物医学 | AnnData、Scanpy、scvi-tools、差异表达、基因组和临床数据 |
| 化学信息学 | RDKit、分子对接、ADMET、SMILES 检查和分子可视化 |
| 科研写作 | 文献综述、引用管理、科学写作、LaTeX、学术幻灯片 |
| 科研绘图 | Matplotlib、Seaborn、Plotly、机制图和信息图 |
| 云端算力 | 远程计算、任务运行和结果管理 |
Skills 能帮助 AI 按专业流程拆解任务,但不会保证科研结论一定正确。软件参数、统计方法、基因注释、文献引用和关键结论仍需要人工核验。
使用建议
从小任务开始
先用小数据或数据子集验证流程,确认代码、依赖和输出目录都正确,再运行完整数据。
明确文件权限
告诉 OpenScience 哪些目录可以读取、哪些目录可以写入,并明确禁止覆盖或删除原始数据。重要项目建议使用副本、版本控制或独立工作目录。
要求保留可复现信息
让它保存代码、参数、随机种子、软件版本和运行日志。不要只保留最后一张图或一段结论。
核对结果与引用
AI 可能生成看似合理但不准确的解释、引用或参数。论文题目、数据库记录、统计结果和生物学结论应回到原始来源核对。
保护敏感信息
不要向模型提交密码、访问令牌、未脱敏患者数据或其他受限信息。涉及临床和隐私数据时,应遵守所在单位的数据管理要求。
常见问题
运行 openscience 后浏览器没有打开
先查看终端是否仍在运行,以及是否打印了本地访问地址。复制该地址到 VNC 桌面的浏览器中打开。不要在自己电脑上直接打开服务器内部的 localhost 地址。
提示没有可用模型或认证失败
确认 API Key 环境变量名称正确、Key 没有多余空格、服务商账户可用,并确保是在设置 Key 的同一个终端中启动 OpenScience。
任务运行时间很长
让 OpenScience 先汇报当前步骤、预计资源和已生成文件。大数据任务建议先用子集测试,并检查服务器内存、显存和磁盘空间。
如何停止 OpenScience
回到启动它的终端,按 Ctrl + C 停止进程。停止前先确认重要代码和结果已经保存。
总结
在钱同学云服务器中使用 OpenScience,最短流程是:
- 进入 VNC 桌面并打开终端;
- 配置自己的模型 API Key;
- 运行
openscience; - 在自动打开的浏览器工作区中确认项目和模型;
- 从小任务开始,先审查计划,再运行分析并核验结果。
OpenScience 的价值在于把科研任务变成连续、可执行的工作流。把目标、数据路径、权限边界和输出要求说清楚,才能更安全、稳定地发挥它的作用。