SciencePal 2.0 · Launch Recap
让每个人都能拥有一支递归自我改进的科研团队:SciencePal 2.0 发布会实录
中国版的 Claude Science,你的自进化科研伙伴。一条自然语言指令,跑完文献、代码、仿真、分析的完整研究链路;一个记得你、也会随你成长的科研智能体——这,就是 SciencePal 2.0。
2026 年 6 月 30 日,香港人工智能与科学研究院在线上举办 SciencePal 2.0 发布会。一个多小时里,马维英教授讲述了科学发现范式的演进,团队核心成员围绕产品与技术展开了一场圆桌对话,并现场演示了三个真实运行的科研任务。本文带你回顾全程精华。
01 · 背景为什么是现在:科学发现的"第五范式"
发布会以马维英教授的主旨演讲开场。他把过去三十年的科学发现,梳理成五个依然并行、缺一不可的范式:实验科学(试错验证)、理论科学(第一性原理,如中心法则、薛定谔方程)、计算科学(大规模模拟、DFT)、数据驱动(如 AlphaFold 借助蛋白质数据库的积累)——而今天,Agentic AI 正把前四种范式集大成,成为"第五范式"。
在未来三十年,我们预计会看到一次科学发现的大爆炸;人类的科学发现总量,也许会超过过去历史的总和。
支撑这一判断的,是他所说的人类文明"三大基座":由人类全部文献与知识训练出、并在近两年内化了软件工程能力的大语言模型;能够调用上百种工具、把对话变成行动的智能体;以及走向实验自动化的物理世界 AI(Physical AI)。三条技术主线,正在同一时刻走向融合。
正是在这样的判断下,一年半前,香港城市大学与清华大学智能产业研究院联合成立了香港人工智能与科学研究院。研究院的使命,一是搭建下一代 AI-Native 的科研机构、推进 AI 核心基础研究;二是与各领域科学家紧密合作,把做科研的门槛极大降低——让科学发现走向普惠,让"一个人也能拥有一支强大的科学家团队"。研究院坚持使命驱动、落地驱动、系统级创新。SciencePal 2.0,正是这一年半系统级工程的成果。
02 · 是什么SciencePal 2.0 的六大核心能力
一段宣传片之后,SciencePal 2.0 的六大核心能力清晰呈现:
- 自我进化的技能(Self-evolving Skills)——智能体从你的对话中创建、打磨、合并自己的技能,并在改动前先征求你的同意;
- 长期记忆(Long-term Memory)——按用户维度、支持语义检索的记忆,跨越每一次会话记住你的上下文;
- 科学智能体团队(Science Agent Teams)——统计学家、文献综述员、代码审查员等互补角色,由一个主控智能体在共享工作空间里协同;
- 持久化沙箱(Persistent Sandbox)——算力环境、技能与记忆在多次运行之间持久保存,接着上次的进度继续;
- 原生学术工具(Academic Tooling)——文献管理、引文图谱导航、文档解析,作为原生技能而非外挂;
- 模型路由(Smart Model Routing)——按需把每个查询路由到合适的模型,在保证结果质量的前提下大幅降低成本。
随后,马维英正式宣布 SciencePal 2.0 发布,并强调它的目标是成为大学与科研机构的基础设施——先从生物、医学、材料切入,再扩展到更多领域。
03 · 圆桌"这不就是套了个壳的大模型吗?"
发布环节之后是圆桌对话,由香港城市大学数据科学系副教授许凯第主持。主持人先抛出一个尖锐的问题:现在几乎每个实验室都在给大模型"套壳",如果直接打开一个通用聊天机器人,到底少了什么?
首席科学家郑翔的回答直指核心:SciencePal 把两件事做成了显式、可编辑、可持续积累的系统——一是 agent 知道什么(记忆),二是 agent 能做什么(技能)。传统聊天机器人通常把这两件事藏在 prompt 里,用完即弃;你关掉标签页,它就几乎从头开始。而 SciencePal 会把它们持久化,而且每个用户都有自己的版本。
CEO 赵迎功从底层补充:SciencePal 不是一段 prompt,而是一个真正的运行时(runtime)。每次请求进来,都会经过完整的 agent loop——模型还没开始"思考"之前,三个钩子先触发:列出当前可用的技能、召回相关记忆、注入团队上下文。与此同时,agent 运行在自己的 Linux 沙箱里,AlphaFold-3、Boltz、Protenix 这类真实科研软件栈已经装好。你让它"测试一下 Boltz",它就真的跑了,而不是写一段看起来像 Boltz 结果的文字。
不是套壳,而是运行时 + 持久沙箱。聊天机器人主要是"说",SciencePal 是"做"——遇到报错会自己修、再重跑,而且运行在一个"明天还在"的沙箱里。
04 · 内核会进化:不押注模型,押注模型外的 loop
"无限进化"听起来像口号,背后是什么机制?郑翔给出了他"最喜欢的一部分":团队从一个判断出发——单个模型本身是会不断被替换的,几个月后一定会有更强、更便宜、上下文更长的模型出现。所以 SciencePal 不把赌注押在某一个模型上,而是押在模型外面的那个 loop 上。真正持续积累的,是三样东西:你的技能、记忆和工作空间。
当你工作时,agent 会根据你反复做过的事情主动提出新技能,给它们打分,建议升级、合并或淘汰;一段反复被证明有用的记忆,也可以"毕业"变成一个可复用的技能。后台有一个常驻 worker 运行这套评分、升级、合并、新建的演化引擎——但哪些留下、哪些不要,最终由你在界面上确认。几周之后,它就不再是一个通用助手,而会变成一个更懂你实验室流程的专属助手。
它真的记得你
记忆系统分三层:交互记忆(忠实保留对话,可回看回放)、项目记忆(沉淀常用工作流与经验)、以及长期交互中沉淀出的用户自我画像——你的"科研品味"。检索采用 关键词 + 语义向量的混合检索(pgvector + BGE-M3 语义,PGroonga 关键词),并在整个对话生命周期里自动更新。记忆并非黑箱:侧栏里你可以查看、搜索、修改,哪条保留、哪条删除由你说了算。更重要的是,记忆与技能完全打通——一段反复有用的经验,最终可以从"记住"变成"会做"。
05 · 团队像导演一样做科研
面对一个很乱、很复杂的问题,SciencePal 会先把相关记忆拉进来、列出可用技能,再做任务规划,把工作拆给几个 sub-agent——比如一个 researcher 负责搜集文献,一个 coder 负责实现与运行代码,都在沙箱里执行,结果再流式汇回主 agent。你可以把自己看成导演,SciencePal 帮你组建一支临时剧组。一个关键细节:它不会把上千条指令一股脑塞给模型,而是按需加载真正相关的那一个技能,让上下文始终精简。
再往上,是"团队(Agent Swarm)"层。你可以定义一组角色——statistician、literature reviewer、code reviewer——每个角色可能只是一个小文件,但主 agent 会像导演一样调度它们。以论文评审为例:它可以并行启动三个 reviewer,再让一个 chair 角色汇总所有意见、写出综合评审。每个角色有独立的工具白名单,却共享同一个沙箱与记忆——不是四个陌生人各待一室,而是在同一张工作台上协作。
06 · 实战从抗体到小分子,从计算到湿实验
圆桌的重头戏,是生物研究负责人张钰莹带来的三个真实运行(而非录播)的演示。她选择药物设计,正因为它足够复杂:从看文献、选靶点、设计分子,到查 protocol、做预实验、分析画图,跨越 AI、药学、细胞生物学、结构生物学、临床医学。SciencePal 的价值,是把这些步骤串成可执行、可追溯、可复用的 pipeline。
案例一 · 新冠抗体设计。靶点是 SARS-CoV-2 刺突蛋白 RBD。团队只用一句话,提供 PDB 模板 7CHF 并指定对抗体重链 CDR-H3 环区做 AI 重设计。SciencePal 自动下载并识别出 7CHF 是三元复合物、选定其中的 BD-604 抗体为模板、分析抗原抗体界面的 19 对关键接触残基,生成一条五步自动化管线(序列设计、逆折叠、结构预测、界面接触分析、多指标过滤),最终输出 20 条候选序列并综合排序。整个任务超过 200 步,过程中还自主修复了 NumPy 依赖缺失与 CUDA 版本兼容异常。
案例二 · COX-2 选择性小分子。条件写得很具体:分子量 300–500、logP 2–4、预测 COX-2 的 IC50 小于 50 nM、对 COX-1 有超过 50 倍选择性、良好口服特性。系统生成约 200 个候选分子,过滤后得到 163 个强命中——排第一者预测选择性比 COX-1 高出约 5,862 倍,远超设定目标。郑翔还补充了一个材料案例:给它一个二氧化硅结构,它跑完结构弛豫与状态方程扫描,返回约 37 GPa 的体模量,中途遇到一次 API 不兼容也自己定位、改代码、跑完。
案例三 · 湿实验验证。香港城市大学 BMS 王力老师在做血管衰老研究,用 SciencePal 设计了一条抑制 GAS6 的多肽,合成 10 条去做湿实验,约 2 条呈阳性结果——从计算设计跨进了真实实验结果。正如团队所说:大多数生物学人关心的不是数字多好看,而是能不能在自己的湿实验里得到验证。
同一个平台,跨材料、生物、化学完成真实科研任务;而且其中一个设计已经走进 wet lab,并通过验证——这就不只是一个好玩的 demo。
不止生物。背后是一整队领域 agent:带数据库路由与 IgBLAST 的抗体 agent、MIMIC 临床 agent、虚拟免疫细胞 agent、材料 agent,还有与计算机学院合作的 AI 课程 agent;每个 agent 在产品里都有自己的详情页与更新日志。这支队伍不是写死的——通过 customize-agent 机制,你可以自定义 agent 的角色、工具与提示词;团队通常一到两周就能为用户上线一个新的专业智能体。
演示中所见都是真实运行,得益于新增的 Replay 功能:每一次运行都可一键生成可分享的 replay 链接,合作者无需录屏或传大文件就能看到完整过程;实验记录本里只需存一条链接。配合把每次 sub-agent、工具、模型调用都画在时间线上的全链路可观测,整个 agent loop 透明、可追溯——这正是学术规范里至关重要的可重复性。对以湿实验为主的课题组,SciencePal 还能充当实验室知识的传承者:把 protocol 之外、口口相传、容易随人员流动而丢失的隐性经验沉淀下来,供后来者跨时间、跨地点学习。
07 · 落地成本、接入与安全
会烧光经费吗?不会。团队从立项起就在保证效果的前提下控制成本。起初受限于模型,每人每天只开放 10 个问题;随着对系统层的持续优化,并从今年四月接入 DeepSeek v4、针对其特性做缓存优化,复杂多轮任务的缓存命中大幅提高、成本显著下降——每人每天额度已从 10 个问题提升到 100 个问题,足够绝大多数用户使用。SciencePal 2.0 也支持多渠道接入:扫码绑定飞书、微信(海外支持 WhatsApp),任务完成有邮件通知,还上线了 blog 内容中心。
安全与隐私。从 agent 运行时层面,SciencePal 有权限约束、用户隐私防护、技能安全扫描与按项目隔离的沙箱;对需要密钥的工具(如 Zotero)做凭据防护。研究上,团队公开发表过多篇关于 red-teaming agent、以及 agent 失效模式的工作——攻防一体:既在造这个平台,也在研究怎么攻破它,这种双重视角反而让系统更可靠。云端部署天然通过权限严格控制数据访问,用户可查看、删除自己的数据,团队不使用用户数据训练模型;对数据要求更严格的机构,还提供能力几乎一致的本地化部署版本。
08 · 边界它会取代科学家吗?
两个问题——SciencePal 会取代科学家吗?出现更强的模型会不会立刻过时?——郑翔的答案都是否定的,而且原因相同。SciencePal 不是要取代科学家,而是要放大科学家。真正重要的问题、判断、研究品味,以及对结果是否有意义的把握,仍然来自人;agent 负责执行、记忆、工具链和重复劳动,并逐渐贴合你的工作方式。就像 Cursor / Codex 之于程序员。
至于更大的模型,团队"当然希望它出现"——模型是可替换的一层,SciencePal 真正积累的,是模型货架上不会自动给你的东西:你的记忆、你演化出的技能、你的领域工具链、你可复现的 workflow。更强的模型只会让同一个平台更锋利。团队在 3.0 想去的方向,是一个 research operating system,把推理、agent 与弹性算力统一到同一个技术栈里。
如果把今天所有的架构名词和缩写都忘掉,只记住一件事——
最好的工具,是那个被你亲手塑造过、所以真正贴合你手感的工具。SciencePal 让你打造属于你自己的、会自我进化的科研 agent:它记得你,学会你的方法,也会每周变得更好。
欢迎访问 sciencepal.ai 注册体验,和我们一起,共同创造科学发现的未来。
附录 · Appendix马维英教授主旨演讲(现场整理)
以下为发布会现场主旨演讲的原文整理,由现场录音转写并初步清洗,仅供参考;口语已略作梳理,个别专有名词以团队公开资料为准,内容未经讲者审定,后续将进一步润色。
谢谢主持人的介绍。今天非常高兴,能有这个机会,向在线的各位观众、同学和老师们,介绍我们 SciencePal 2.0 的发布。稍后在发布环节之后,我们还会有一个圆桌论坛,我的同事会进一步详细介绍 SciencePal 2.0 的一些核心功能。在此之前,我想先用大约十分钟,跟大家简单介绍一下这个项目的背景。
首先,我想借这个机会,介绍一下整个科学发现的范式。过去三十年,科学的发展经历了五个范式的演进;直到今天,这五个范式依然都非常重要,并不是说哪一个可以完全取代另一个。但我认为,发展到今天,Agentic AI 已经能够把前面四个主要范式集大成——我称之为第五范式。
第一范式,是实验科学,也就是 try and error。特别是在很多自然科学里,都需要通过实验来验证,例如生物实验、材料科学、能源……而随着自动化技术和高通量实验的发展,实验验证这一环节,未来还会被进一步加速;我们可能会看到越来越多的无人实验室,进行大规模、高通量的实验。
第二范式,是理论科学。随着实验科学的积累,科学家们逐渐形成了许许多多的理论与第一性原理——例如生物领域的中心法则,材料科学里的各种偏微分方程、薛定谔方程、DFT 计算……这些理论,能够指导各种实验环节的设计。
第三范式,是计算科学。当计算机出现,科学探索进入了用大规模计算来模拟各种实验的阶段,其中既包括 DFT 这类计算,也包括 physics-informed 的 AI for Science。
第四范式,是数据驱动。过去这几年,随着大数据的积累,我们看到了非常多 AI for Science 的模型,例如 AlphaFold 2、AlphaFold 3——正因为有像 Protein Data Bank 这样大量积累的蛋白质结构数据,我们才能训练出这些强大的、通常是单一功能的机器学习模型,去解决一些专门的任务。这些工具非常强大,也在过去几年进一步推动了 AI for Science。
而今天,我认为第五范式会把前面这几个范式集大成。所以在未来三十年,我们预计会看到科学发现的一次大爆炸——也许在未来三十年,人类整体的科学发现,会超过过去历史的总和。
在第五范式的进程中,我们也看到了人类文明接下来的三大基座。第一大基座,是由人类所有的文献、文本、自然语言和知识积累训练出来的大语言模型;特别是在过去一两年,大家看到 Coding Agent 把软件工程的能力集成进了大语言模型——只要是知识能够表达、能够用软件完成的任务,今天的 AI 已经能够非常高效地完成。第二个基座,是智能体:AI 开始能够大规模地调用各种工具,从对话式的 Chatbot,走向能够执行、能够 take action;它在推理过程中调用上百个科学计算工具,通过长链条的推理,去完成原本科研人员可能需要数月才能完成的任务。第三,我认为这些能力将来会进一步内化到大语言模型里,让人类的理性、知识、思维与推理能力,进一步推进到微观世界、生命科学的世界与材料世界,甚至将来我们会看到这两个世界的融合。而第三大基座,是物理世界的 AI(Physical AI)——我认为它最大的应用,将来就是在实验环节去自动化实验室,例如大规模、高通量的实验。
人类的三大基座,加上三个 AI for Science 的范式,今天都走到了一个融合的阶段。因此我们非常兴奋,能够在这个阶段开始做这样一件事情。一年半前,我们在香港城市大学,与清华大学智能产业研究院一起合作,成立了香港人工智能与科学研究院。我们结合了两边杰出的科学家,既包括很多领先的 AI scientists,也包括生物、材料、能源等各个科学领域的专家。
我们研究院的使命:第一,是推进 AI 的核心基础研究,目标是搭建一个下一代的、AI-Native 的科研机构;在这个过程中,我们希望培养更多新一代的人才,让他们在下一个三十年,去驱动新一轮的科学发现。有了最先进的 AI 技术,再与科学领域的科学家紧密合作,我们的目标是——将来希望让人人都可以成为科学家,把科学探索的门槛极大地降低。某种程度上,我们希望把科学发现普惠化(democratize),让几乎每一个人,都能拥有一支强大的科学家团队,去尝试很多突破,而且是一个大规模的系统。所以我们研究院所探索的科学方向,是能够大规模展开、使命驱动(Mission-Oriented),同时是落地驱动(Deployment-Driven)、系统级创新(System-Level Innovation)的。
这也就回到了我们今天的这个机会——我们发布团队这一年半合作开发的 SciencePal 2.0 系统。在我的同事进一步详细介绍系统功能之前,先让我播放一段视频,来 highlight 这个系统。
(播放宣传片)
SciencePal 2.0 有六个核心能力:第一是自我进化的技能(Self-evolving Skills),第二是长期记忆(Long-term Memory),第三是科学智能体团队(Science Agent Teams),第四是持久化沙箱(Persistent Sandbox)——沙箱让我们在调用大量工具时有一个执行环境,未来它还可能纳入湿实验、高通量实验等生物学实验能力;此外,我们还集成了非常多的学术工具,也会比较智能地调用各种基座模型来完成任务。稍后,我的同事们会更详细地介绍这六个核心能力。
在结束这个演讲之前,我想强调:今天,AI 正在改变大学的教育、改变大学的科研,也在改变将来的产业发展。我们希望 SciencePal 将来能成为大学与科研机构的一项基础设施,去支撑原有的各个科学领域——我们会先从生物、医学和材料开始,将来再继续扩展到更多领域。我们的目标,是培养下一代人才,让他们能够去创业;科学一旦被推进,我相信会带来非常多新的产业机会。同时,我们也希望产生真正的经济影响(economic impact),去支撑下一个阶段人类的科研、教育与创新。
接下来,我正式宣布:SciencePal 2.0,正式发布。
附录 · Appendix圆桌对话实录(现场整理)
感谢马老师开场,欢迎各位嘉宾。接下来我们会进行一个圆桌会议讨论,在此之前,我想先聊一件事,我相信在座很多人都经历过:在科研任务中,我们需要在大模型使用界面打开了多个对话框,有时候为了让模型给出一个真正可靠的答案,你不得不重复的介绍整个项目——包括你的数据是什么、方法怎么做、上一次跑到了哪里、为什么这个结果重要。
每打开一个新的对话,一切几乎都从零开始。今天,我们想终结的正是这件事。
我是 Kaidi,香港城市大学数据科学系副教授,这次圆桌会议的主持人。坐在我左手边的,是打造 SciencePal 2.0 的几位核心成员:我们的 CEO Yinggong;首席科学家 Xiang;以及 我们生物研究部分的负责人Yuying。稍后,她会用真实的实验室场景,给大家演示 SciencePal 到底能做什么。
Yinggong,先用一句话告诉大家:SciencePal 是什么?
从上次更新,也就是 3 月以来,都有哪些新的功能加人了SciencePal?
我先替来问一个尖锐的问题。许多人认为现在很多实验室和公司在做的事情是给大模型“套壳”,跟他们相比,我们的优势是什么?
我可以来试着回答一下这个问题!大家好,我是郑翔,目前在研究院担任研究助理教授,同时也有幸担任SciencePal 2.0的首席科学家,负责SciencePal 2.0的几项核心功能设计与开发。
kaidi老师的这个问题问得特别好。对于一个科学智能体平台,我们比拼的正是这层harness,谁的harness写得又轻又好,用起来顺手,谁的产品就越容易受到用户的青睐。
对于还停留在聊天机器人的智能体产品,我们的优势是拥有两大核心子系统,一个是让agent记住用户所有过往经验的记忆系统,另一个则是让agent学会用户工作流与专家知识的技能系统。他们结合起来,就能让SciencePal和科学家的合作越来越默契。
此外,SciencePal也设计了贴合AI for Science场景的Sandbox持久化与GPU算力支持,让科学家们能够轻松定制自己的专属科研工具,这个我们的yinggong老师可以再补充一下。
也就是说,其他chatbot是帮我把代码写出来;但SciencePal 是真的把代码跑了起来。
你们刚才提到“无限进化”,这个词听起来很有想象力。背后到底有什么机制支持它?
哈哈哈,这个问题我也来先回答一下。其实无限进化是我们的宣传语,听起来很炫酷,更学术地叫法是自我进化,或者递归自我改进,这是我最喜欢的智能体概念之一。
想要说清楚背后的机制,我们还得从智能体内部调用的基座模型说起。我们都知道,从GPT 3到Fable 5,每隔一段时间就会有更强大的模型出现。然而,对用户来说,真正有价值的,其实是一次次与科学智能体合作中沉淀下来的宝贵数据,这些数据体现在至少三个部分:skills,memory ,还有sandbox里的一切项目文件。
为了让用户的智能体能够轻松实现“自进化“,我们推出了这样一个功能,SciencePal能够基于用户当天完成的科研任务,自主地创建成有价值、高质量、可复用的skills,SciencePal智能体的每一次记忆的总结与反思、技能的评分与改进,都是在完成一次自进化。
所以不需要我每次推着它去进化,而是SciencePal主动观察我的工作方式,慢慢更新出更适合我自己的工作流。
对,而且我们平台内置的skills都是生产级别的skills,每一个都经过我们精心打磨,在数千亿tokens消耗下的真实科研任务中总结、凝练与验证后,才呈现给用户。
你们一直强调SciencePal的记忆功能很强大。具体来说,它在记些什么?记忆又如何发挥作用?
我们的记忆系统可以大致分为三层:
第一层是交互记忆,记录用户与智能体交互的完整任务信息;
第二层是项目记忆,包含用户在项目中积累下来的各类知识、经验和总结;
第三层则是用户画像,是跨项目的记忆文件,记录着最贴合用户的科研习惯与品味。
记忆系统的构建得益于我们持久化沙箱这一平台特有的基础设施。这些记忆在用户开启一项新的科研任务时被有选择的激活,每一条记忆的检索都通过关键词与向量混合检索算法,确保检索的准确性。
我们可以切换回屏幕,由yinggong老师为大家展示一下具体的记忆文件。
这么说,它可能比我团队的学生还了解我更喜欢在不同场景使用哪些不同的工具。
是的,而且平台的memory 和 skill 是完全打通的:一段反复有用的经验,最后就会被沉淀成skills。
我们可不可以具体一点,说点实战相关的内容?假设我是一个科研者,一开始我直接丢给它一个很复杂的问题。SciencePal 会怎么处理?
是的。说到编排,除了subagent的编排,一个复杂的科学研究流程中通常需要多个skills的配合,每个skill都会动态加载,这也可以看作是一种编排。
好,架构方面我们已经聊了不少。Yuying,接下来交给你,我们来看一下真实的使用场景。
这看起来确实非常令人惊叹,那除了抗体设计,还有其他case吗?
看了两个case我明白了,sciencepal不是一段建议,而是真正交付了一组可比较、可排序的候选结果。
sciencepal做的science能得到生物学家的认可吗?
有通过湿实验的案例吗?
对,这是一个很好用的功能。SciencePal 里的每一次 agent 运行都可以一键生成一个公开的replay链接,用户只需要把这个链接发给合作者,对方就能轻松查阅整段研究过程,不需要复杂的录屏和大文件传输。
感谢 Yuying。总结一下,sciencepal 可以执行两三百步的复杂任务,并且已经有设计走进了湿实验室、通过了验证。所以这不只是一个好玩的 demo 了。我很好奇,除了生物,sciencepal 还能解决其他学科的问题吗?
对,而且我们也为用户提供了自定义智能体的功能,让用户可以自定义智能体的技能、工具和系统提示词。
看来agent的功能和玩法你们为用户预准备了很多,有待用户持续探索。
而且从刚才的演示看起来,这是一个agent团队合作的过程,里面有非常多的角色,能不能具体讲一下他们的合作模式?
这里的团队有两个含义,一个就是yinggong提到的我们在首页可以看得到的跨领域的agent团队,另一个则是一个科研任务进行中才能看得到的动态编排的子智能体。你可以在一个任务中定义一组角色,分别负责文献调研、代码审核、数据分析等等,并由编排智能体把它们调度起来。
我再问一个经常会被质疑的问题,就是SciencePal会不会看起来像一个很大工程项目。那它的科学严谨部分体现在哪里?SciencePal返回给我们一个实验结果,我们凭什么相信它?
对,SciencePal 的每个结果都要求可复现、可追溯。获得实验结果的每一步工具调用都记录在沙箱的工作区内,方便用户对实验结果做校验。
对,而且 Yuying 提到的湿实验,也验证了我们的 SciencePal 已经不只是普通能跑文字流程的智能体,而是能够交付真实的科研产出。
就是把用户可能遇到的小 bug,尽量都磨平。
这么多 agent 跑来跑去、反复调用模型和工具,一个月下来会不会把 PI 的经费烧光?
也就是说token消耗不是问题,我们各种优化使得SciencePal已经成为了一个性价比极高的产品了。
OK,那从易用性的角度来说,我们是不是一定要坐在电脑前,才能用 SciencePal 吗?
哈哈,那听起来以后地铁上也能搞科研了。OK,那这套系统既能跑别人写的代码,还能连真实数据库,也能装第三方 skill,那是否会有安全和隐私问题?这个也请 Xiang和Yinggong 回答。
安全和隐私是我们的主线之一。在harness层面,我们做了agent权限约束、skill风险扫描、用户数据防护等设计。研究上,我们团队也公开发表了多篇关于自动化红队的学术文章,设计了多种智能体系统安全评估与增强的算法。我们会在未来逐步把这些科研成果转化落地到SciencePal平台的风险监测与安全防护上来,打造负责任的科学智能体平台。
除此之外还有什么这方面的考量?
最后,我们来谈两个所有人都关心的问题:一是SciencePal 会不会取代比如生物学家、材料学家或者其他方向的科研人员?另一个更现实的问题是 如果未来出现一个更大、更聪明的模型,SciencePal会不会过时?
从我的角度来看,两个答案都是否定的。SciencePal不会取代科学家,而是要放大科学家的能力。sciencepal负责感知、规划、执行、验证等环节,最难的科学问题的提出,还是依赖科学家的判断。至于更大更强的模型,我们当然希望它出现。这意味着我们开发者的harness可以做得更轻更薄,也让科学家可以更轻松地演进智能体的记忆、技能与工作流。
最后收个尾。如果大家把今天所有专有名词和缩写都忘掉,只记住一件事,你们希望那是什么?
谢谢三位。接下来我们进入问答环节,将由我们 institute 的助理教授苗宁老师主持,欢迎线上的朋友通过聊天框提问。
SciencePal 如何保证用户上传数据的安全性?
再次感谢各位老师!今天 SciencePal 2.0 发布会到这里就正式结束了,希望大家积极使用,也期待下次与各位再会!
SciencePal 2.0AI for ScienceHKAI-Sci发布会