AI Foundation Models and Their Applications
从 ChatGPT 进入大众视野开始,人工智能就不再只是计算机科学领域的专业概念,而是迅速成为科研、创作、办公和日常生活中都绕不开的新工具。无论是用大模型生成文字、图片和视频,还是让 AI agent 帮助写代码、查文献、分析数据,AI 正在把许多原本需要专业技能和大量时间的工作,转化为可以通过自然语言驱动、反复迭代完成的任务。与此同时,AI 也带来了新的问题:我们究竟该如何理解大模型?如何正确使用它们?它们能够帮助科研到什么程度,又有哪些边界和风险?
本次 Journal Club 以 “AI Foundation Models and Their Applications” 为主题,围绕基础模型的概念演进、AI 在创作场景中的使用方式,以及 AI agent 在生物学研究中的应用展开。整个报告并不是单纯介绍某一个软件或模型,而是试图建立一个更完整的理解框架:从人工智能是什么、为什么在近年突然爆发,到普通用户如何把 AI 作为创作工具,再到科研人员如何将 AI 嵌入真实的研究流程中。
一、理解 AI 基础模型与现代 AI 概念
第一部分首先回顾了人工智能从 1943 年至今的发展脉络。人工智能的历史并不是一条直线上升的道路,而是经历了理论奠基、AI 诞生、专家系统繁荣、两次 AI 寒冬、深度学习兴起、Transformer 时代、生成式 AI 革命以及智能体时代等多个阶段。从图灵测试、感知机、专家系统,到 ImageNet、AlexNet、AlphaGo、GPT、DALL-E、ChatGPT 和各类 agent 系统,AI 的每一次跃迁都依赖于算法、数据和算力的共同推动。
报告进一步解释了人工智能的核心含义:让机器具备感知、学习、推理、决策和交互能力,从而完成原本需要人类智能才能完成的任务。在现代语境下,大语言模型、API、token、vibe coding、AI agent、AGI 和 ASI 等概念频繁出现。Vibe coding 指的是通过自然语言描述需求,由 AI 生成代码并在人的反馈中不断迭代;AI agent 则比普通问答式大模型更进一步,它具有“感知—决策—执行—反馈”的闭环能力,能够围绕目标自主拆解任务、调用工具并持续推进工作。
在模型生态方面,报告比较了当前具有代表性的 AI 系统,包括 OpenAI 的 GPT 系列、Google 的 Gemini、Anthropic 的 Claude、DeepSeek 以及字节的 Seedance 等。不同模型在文本推理、代码生成、图像生成、多模态理解、开放生态和成本效率上各有特点。AI 也已经深度进入医疗、生物学和科学发现领域,例如 AMIE、MIRA、AlphaFold,以及用于生成式生物学的 Proto 框架等案例,说明基础模型不只是“聊天工具”,而正在成为科学研究中的基础设施。
这一部分也特别强调了 AI 的边界。大模型看似能够推理和思考,但其底层仍很大程度上依赖概率建模和模式学习,并不等同于人类基于身体经验、物理世界和主动能动性形成的理解。因此,报告将“世界模型”和“agency”作为后续 AI 发展的重要方向来讨论:AI 可以成为放大器,但不能替代人的判断力、方向感和提出问题的能力。
二、AI 在创作场景中的应用
第二部分从更加实际的角度讨论普通用户如何真正“用上 AI”和“用好 AI”。首先,报告介绍了使用 ChatGPT、Claude、Gemini、YouTube 等工具时常见的账号、登录和订阅问题,包括 Google 账号、Apple 礼品卡、虚拟信用卡、第三方代充值或代订阅等不同路径。不同方式在便捷性、安全性、成本和账号可控性上存在差异,需要根据具体需求谨慎选择。
在真正使用 AI 时,提示词质量决定了输出质量。报告介绍了 CRISPE 框架:Capacity and Role 指定 AI 的角色和能力,Insight 提供背景与上下文,Statement 明确任务指令,Personality 规定回答风格,Experiment 要求模型给出多个版本或方案。相比直接提出模糊需求,结构化提示词能帮助 AI 更准确地理解目标、受众、风格、格式和限制,从而生成更可用的结果。
在图像创作方面,报告展示了 AI 修图和生成图像的多种用法,例如老照片上色、证件照制作、人物表情修正、图像转写提示词、创作插图和科研场景图像生成等。ChatGPT、Gemini、Seedream、豆包等工具都可以在不同场景下完成图像生成或编辑任务。AI 生图的关键不只是“让模型画一张图”,而是通过明确对象、背景、风格、构图、用途和限制,让图像更接近真实任务需求。
视频生成则进一步扩展了 AI 创作的边界。通过文生视频、图生视频、分镜设计、提示词生成和后期剪辑,AI 可以辅助完成短片或演示素材制作。报告还将 AI agent 与 Codex 等编程助手联系起来,说明 agent 不只是创作玩具,也可以作为连接不同模型和工具的平台,帮助用户完成从想法到原型、从素材到作品、从需求到执行的全过程。
三、AI agent 在生物学研究中的应用
第三部分聚焦于 AI agent 在科研工作流中的实际价值,尤其是果蝇研究、生物信息学分析、神经连接组分析和科研助手场景。传统科研软件往往要求研究者熟悉 R、Python、命令行、网页平台和各种专业数据库;当分析流程复杂、报错信息难懂或跨工具协作频繁时,AI agent 可以作为新的交互层,帮助研究者解释错误、生成代码、组织流程并调用外部工具。
在测序分析方面,报告比较了传统网页对话式工具、RStudio、Posit Assistant、Positron 和 Claude Code 等工具。RStudio 和 Positron 本身已经能够承担一部分数据分析工作,但 RStudio 在跨语言和更复杂 agent 化流程上仍有限制;Positron 和代码类 agent 则更适合在 R 与 Python 混合分析、脚本生成、错误排查和结果迭代中发挥作用。对于生物学研究者而言,这意味着 AI 不仅能回答“怎么做”,还可以参与“写代码—运行—报错—修改—再运行”的闭环。
在果蝇研究和神经连接组方向,Codex 这类 agent 可以帮助处理 FlyWire 等项目中的命名、数据文件、分析脚本和结果整理问题。报告还推荐了若干可增强 agent 工作能力的技能库,例如 superpowers、academic-research-skills、nature-skills 和 karpathy-skills。这些技能把文献检索、论文写作、图表生成、代码审查和科研分析流程封装成更可复用的工作模式,使 AI agent 更接近一个可配置的科研助手。
作为科研助手,AI agent 的应用场景还包括文献综述、数据分析与绘图、论文写作、方法整理以及工具链管理。Codex 和 opencode 等工具能够在本地文件、代码、终端和研究资料之间建立连接,帮助研究者完成重复性强但又需要判断的工作。不过,报告也提醒我们,AI 的价值并不是替代研究者,而是降低技术门槛、加快试错速度,并把更多精力留给问题提出、实验设计、结果判断和科学叙事。
总结
本次 Journal Club 从基础概念、创作应用和科研实践三个层面梳理了 AI 基础模型及其应用。第一部分帮助我们理解 AI 的历史、关键术语、主流模型和技术边界;第二部分展示了 AI 在提示词、图像、视频和 agent 创作中的实际使用方法;第三部分则把 AI agent 放入生物学研究流程中,讨论其在测序分析、连接组研究、文献综述、数据处理和写作中的辅助作用。
总体来看,AI 正在成为一种新的通用生产工具。它可以生成图片和视频,可以帮助写代码和分析数据,也可以参与科研资料整理与工作流自动化。但真正重要的并不是“AI 能替我们做什么”,而是我们能否提出清晰的问题、判断输出质量、理解工具边界,并把 AI 作为放大器而不是大脑来使用。随着 AI 快速发展,学会合理、主动、批判性地使用 AI,将成为科研训练和日常工作中的一项基础能力。
本次 journal club 的 slides 见附件:
by 李小龙


