你是一名资深医药行业卖方分析师,同时也是券商行业报告PPT的主笔和审稿人。 附件包括: 1. 当...
Creato il: 6 settembre 2026
Creato il: 6 settembre 2026
你是一名资深医药行业卖方分析师,同时也是券商行业报告PPT的主笔和审稿人。
附件包括:
当前版本PPT/PDF:
《AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906》
《王云鹏 建投医药—2026-09-01语音任务纪要》
请先完整阅读两个附件。
你的最终任务不是写一篇研究报告,也不是输出长篇审稿意见,而是:
其中最重要的是:
逐页优化PPT标题和正文文案,使其更加像成熟的医药卖方行业报告,语言自然、书面、平实、数据驱动,不要有明显AI味。
其次才是:
这套PPT不是泛泛介绍海外AI制药公司。
最终主线是:
蛋白大模型持续迭代
→ 参数量、训练数据和计算投入扩大
→ 模型由结构预测向de novo设计发展
→ 计算端可以更快生成和筛选大量候选
→ 真实候选仍需进入DNA合成、蛋白表达、纯化、SPR/BLI和功能验证
→ 湿实验形成真实表达、结合、活性、失败负样本等标签
→ 标签继续反馈模型迭代
→ AI设计规模扩大可能带动高通量湿实验需求增加
→ Twist、Adaptyv Bio、GenScript等平台成为这一需求的承接方
→ 进一步判断定制蛋白服务的产能、价值量和进入壁垒
领导最关心的不是“AI模型有多先进”,而是:
如果模型继续发展,未来会产生多少真实实验需求?
这些需求最终落在哪些产业链环节?
Twist、Adaptyv、金斯瑞为什么可能受益?
因此每一页都要服务于这条主线。
请逐页审阅P19-P45。
对每一页都判断:
最终重点不是“指出问题”,而是:
请严格采用中国医药券商卖方PPT的书面风格。
关键词:
书面、平实、克制、数字优先、逻辑清楚。
参考表达:
避免宣传稿和AI稿风格。
不要频繁使用:
尤其减少以下典型AI句式:
“值得注意的是……”
“这意味着……”
“不仅……更……”
“由A走向B”
“进一步……进一步……进一步……”
“形成闭环”
“其核心在于……”
“这一案例充分说明……”
不是完全禁止,而是避免重复和机械套用。
标题不要只是“公司介绍”或“技术介绍”。
尽量使用:
事实变化 + 结论
例如:
不要:
“Chai Discovery:AI分子设计新锐”
可以:
“Chai由结构预测向de novo设计迭代,Chai-2已完成多靶点湿实验验证”
不要:
“Xaira:AI驱动药物发现的新兴力量”
可以:
“Xaira整合模型、扰动数据与湿实验,推进端到端药物发现”
不要:
“行业壁垒分析”
可以:
“规模化合成、表达与表征形成多环节进入要求”
标题应尽量让读者只看标题就理解这一页的结论。
当前PPT多数页使用2-3条正文,原则上保持。
推荐结构:
背景 / 技术变化 / 公司定位
最重要的数字证据
产业意义 / 边界 / 投资含义
但不要机械三段式。
如果两段已经说清,就只留两段。
正文长度原则:
一句话里尽量只表达一个主逻辑。
优先保证中文通顺。
请把每一页当作真正要交给卖方首席审稿的PPT处理。
尤其检查:
专业名词可以保留:
de novo
binder
hit rate
SPR/BLI
FLOPs
token
DBTL
ProteinMPNN
RFdiffusion
但普通表达优先中文。
现有PPT涉及大量“训练、生成、实验”的数字。
请始终严格区分:
training data
training steps
GPU
FLOPs
参数量
计算生成多少候选
in silico筛选多少候选
真正合成多少
表达多少
测试多少
做了几轮
获得多少binder
hit rate多少
不得混写。
比如:
ESM3的约430K steps
是模型训练步数;
esmGFP两轮各96个候选
是实验设计和筛选轮次;
两者不是同一个概念。
请特别认真处理以下页面。
回答:
不同de novo binder项目的hit rate为什么不能直接比较?
重点保留:
不要承担太多产业链结论。
回答:
蛋白模型训练到底用了多少参数、数据和计算量?
重点:
查不到就写:
“未披露”
不要推测。
这是重要页面。
回答:
Chai、ESM、AlphaFold不同代际究竟发生了什么变化?
建议围绕三个维度:
训练侧
→ 参数/数据/模态
设计侧
→ 从预测走向生成
验证侧
→ 从benchmark走向真实湿实验
重点把:
ESM2→ESM3
Chai-1→Chai-2→Chai-3
AF2→AF3
写清楚。
标题和正文请重新优化,避免“训练数据扩容、湿实验随之加码”这种因果过强的说法。
这一组是:
AI模型设计以后,谁来完成build和test?
重点串联:
Anthropic
→ Adaptyv
→ Twist
→ GenScript
检查:
不要再重复P34的ESM3训练数字。
本页应该回答:
公开训练数据大家都能拿到以后,什么数据仍然需要自己生成?
重点:
公共数据:
PDB / UniRef / MGnify / AFDB / OAS等
vs
实验标签:
表达成功/失败
binding
activity
specificity
developability
negative data
标题和正文都请围绕这个问题重写。
这是整个后半章最重要的一页之一。
它要回答:
请把逻辑写清楚:
百万级计算候选
≠
百万级真实合成
但现实湿实验已经从:
几十条
→ 百条
→ 千条
发展。
需要通过公开价格做一个简单scenario。
注意:
Twist:
DNA-only价格
Adaptyv:
sequence-to-binding价格
两者服务范围不同。
不得简单相加后称为单条总成本。
建议用独立情景:
例如可以考虑:
1,000条
10,000条
100,000条
分别对应大致数量级。
必须注明:
“按公开目录价线性外推,仅用于量级参考,不代表实际项目报价。”
这一页文字要非常像卖方PPT,
不要像学术论文。
不要再次罗列公司报价。
应该回答:
为什么DNA合成只是起点,价值量会继续向蛋白表达与功能表征延伸?
逻辑:
DNA synthesis
→ protein expression
→ purification/QC
→ binding
→ function
→ developability
回答:
为什么定制蛋白服务并非只有一台合成仪就能进入?
重点:
结论要克制。
不要无证据写:
“后进入者追赶以年计”
“切换成本极高”
“单位成本显著更高”
更建议写:
“形成多环节进入要求”
“对规模化交付和流程稳定性提出较高要求”
“有望增强头部平台客户粘性”
不要单独做一份长篇“图片研究报告”。
只告诉我:
哪一页现有图不够好,以及应该换成什么图。
优先找:
每个建议最多写:
页码
图名称
来源
Figure/Panel
链接
为什么比现在好
重点找以下类型:
如果没有合适原始图,
直接建议“自行重绘”。
不要找stock image。
请不要输出大段行业研究报告。
我要的是一个:
严格按下面格式。
==================================================
XXX
XXX
XXX
XXX
XXX
保留 / 替换 / 新增
如替换:
原始来源+链接
只写真正需要核验的数据。
==================================================
一直做到P45。
然后再输出:
只写确实值得调整的页面。
格式:
PXX + PXX
原因:
建议:
==================================================
最后输出:
用8-12句话把整套PPT串起来。
不是写文章,
而是告诉我:
每一页为什么接下一页。
例如:
P33解决hit rate口径问题
→
P34回答模型训练投入
→
P35回答模型代际变化
→
P36开始进入真实实验链条
→
……
→
P43把实验量转为需求量级
→
P44解释价值量分布
→
P45落到供应链进入要求。
最后请重新读一遍你修改后的全部P19-P45。
判断标准只有一个:
如果这是中信建投医药正式行业报告PPT,文字是否自然、可信、克制、通顺,并且每一页都有存在的理由?
如果某一句读起来像AI写的,
继续改。
如果一个词删掉不影响信息,
优先删除。
如果一句话没有数字、事实或逻辑作用,
优先删除。
不要为了“高级”而复杂化表达。
不要重新做一个Word报告。
最终输出必须以:
为标准。
海外平台技术路线各有侧重,真实候选仍需经过实验筛选
海外平台分别从通用模型编排、蛋白生成、复合物预测及扰动数据建模切入。公司定位、分子类型和评价任务不同,不宜仅以参数规模或命中率比较研发能力。
公开结果已覆盖结合、结构及部分功能验证,但这些结果并不等同于候选药物的体内药效、安全性或临床验证。本章重点比较模型输出如何进入实验,以及相关需求由哪些平台承接。(Anthropic)
表名改为:海外代表平台的技术定位与公开验证内容
| 平台 | 技术定位 | 主要研究对象 | 本章引用的公开证据 |
|---|---|---|---|
| Anthropic | 通用模型编排专业设计工具 | minibinder | 外部实验平台完成表达与结合检测 |
| Xaira | 分子设计、扰动数据与药物研发结合 | 蛋白、抗体及疾病生物学 | 结合、可开发性评价及细胞扰动预测 |
| Chai Discovery | 结构预测与生成式分子设计 | 抗体、纳米抗体、miniprotein | 结合、结构及部分功能实验 |
| ESM/Biohub团队 | 蛋白表征、生成与结构预测 | 功能蛋白、结合蛋白 | 荧光功能、结合及部分细胞功能实验 |
| Isomorphic Labs | 结构、口袋及亲和力预测 | 小分子及生物分子复合物 | 结构与亲和力等计算基准 |
表格不再列融资金额、市值及笼统的“有无自有管线”。(Xaira Therapeutics)
保留表格,不新增图片。 删除“验证深度趋同”等概括性图中文字。
原页“尚无动物或临床数据”“仅Xaira推进自有管线”等表述,不宜用于概括五家公司的全部研发进展;表中应限定为“本章引用案例的公开证据”。(AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx)
Anthropic将Claude接入科研工具,应用范围扩展至蛋白设计与实验分析
Anthropic最初通过API额度支持科研项目,随后接入生命科学数据库、分析工具和计算资源。Claude在这一体系中主要承担任务规划、工具调用和结果整理,并非替代专业模型或实验设备。(Anthropic)
2026年,公司推出Claude Science工作台,并披露蛋白设计与外部湿实验验证案例。其与本章相关的进展,是将计算设计、实验委托及数据分析衔接起来。(Anthropic)
将原九行时间表压缩为四行。
| 时间 | 主要进展 | 与蛋白设计相关的作用 |
|---|---|---|
| 2025年5月 | 推出AI for Science项目 | 提供模型访问与科研支持 |
| 2025年10月 | 发布Claude for Life Sciences | 接入生命科学数据库及专业工具 |
| 2026年6月 | 推出Claude Science工作台 | 整合文献、代码、模型及算力 |
| 2026年8月 | 披露蛋白设计实验结果 | 计算候选进入外部制备与结合检测 |
保留时间轴,删除外围合作事项。 盖茨基金会合作、罕见病计划及招聘信息不再占用本页。
—
Claude编排专业模型完成蛋白设计,15个靶点中14个获得binder
Claude负责选择设计策略、调用专业模型并筛选计算候选。多靶点任务自主运行48小时,计算预算上限为12,500 H100 GPU-hours;该数值属于设计阶段的推理预算,不是模型训练投入。(anthropic.com)
纳入最终分析的1,320条设计中,共获得354个binder,候选级命中率为26.8%,15个靶点中14个获得命中。蛋白制备及检测由Adaptyv Bio和Twist完成,结果按研究预设规则汇总。(anthropic.com)
图名改为:Claude蛋白设计实验:各靶点命中结果及送检分母
流程文字统一为:
任务设定 → 专业模型调用 → 计算筛选 → 外部蛋白制备与检测 → 结果汇总
保留各靶点柱状图中的送检数量,不只展示百分比。不同模型及运行模式使用各自分母。
保留命中率图,使用原技术报告Figure 1的完整口径。
来源:Anthropic蛋白设计技术报告,Figure 1。完整图能同时展示失败靶点和实际分母,优于仅保留总体命中率。
研究实际制备数量与最终分析数量不同:报告记载共制备1,440条设计,其中成熟GDF8相关120条因靶蛋白聚集问题被排除;1,320条是最终分析口径。不得将其分配给每个模型,或直接写成全部实际合成量。(Anthropic)
Claude可解析原始仪器数据,现有结果仍限于单一样品案例
在一份常规质控样品的测试中,Claude直接读取NMR与LC-MS原始文件,分别用23分钟和19分钟完成处理并输出结果。LC-MS测得纯度为96.4%,与CRO报告的96.33%接近。(Anthropic)
该案例表明通用模型可辅助处理实验仪器数据,但不能据此认定样品制备、仪器检测及结果判定均已自动化。跨样品、跨仪器的稳定性仍需更多验证。
| 任务 | 模型输出 | 已披露结果 |
|---|---|---|
| NMR解析 | 处理后谱图及信号峰表 | 23分钟,18个信号 |
| LC-MS分析 | 色谱、质谱及纯度结果 | 19分钟,纯度96.4% |
| 证据范围 | 单一样品质控案例 | 不代表完整实验流程自动化 |
保留现有NMR输入输出图。
删除“设计—验证—解析全链均由AI承接”。本例与前页蛋白设计项目不是同一套完整实验流程。建议本页移至附录。
Xaira同时布局分子设计与扰动数据,自建实验支撑药物研发
Xaira将蛋白及抗体设计、生物学数据生成与药物研发纳入同一体系。分子设计侧采用RFdiffusion、ProteinMPNN、RFantibody等技术;疾病研究侧通过细胞扰动数据分析靶点及作用机制。(AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx)
实验不仅用于确认候选是否结合,还用于评价表达、稳定性、非特异性及功能表现。公司以此筛选具有后续开发价值的分子,而非只追求初始结合命中。(Xaira Therapeutics)
原技术工具表压缩为三类。
| 模块 | 主要工具或数据 | 研发作用 |
|---|---|---|
| 分子设计 | RFdiffusion、ProteinMPNN、RFantibody等 | 生成蛋白骨架、序列及抗体候选 |
| 疾病生物学 | X-Atlas、X-Cell | 分析基因扰动与细胞响应 |
| 实验筛选 | 结合、表达、稳定性及功能评价 | 筛选可继续开发的候选 |
保留表格。 不再增加创始团队或融资信息图。
RFdiffusion、ProteinMPNN等属于公开技术体系,不宜直接列为Xaira独占的模型资产。
X-Cell以大规模扰动数据训练,研究对象是细胞响应而非蛋白结合
X-Cell基于X-Atlas/Pisces数据训练,数据集包含约2,560万份扰动单细胞转录组,来自7个CRISPRi Perturb-seq筛选体系。最大版本参数量约49亿,用于预测基因扰动后的细胞状态变化。(Xaira Therapeutics)
这类数据主要服务于疾病机制研究和靶点判断,与蛋白表达、结合及功能筛选属于不同实验体系。其对药物研发的价值,仍需结合后续候选验证评价。
图中只保留三个信息层次:
输入:基因扰动与对照细胞状态
训练数据:约2,560万份单细胞转录组
输出:预测扰动后的细胞响应
删除正文及图中重复的细胞数量、细分组合数量和网络维度。
保留现有X-Cell图,但仅保留数据来源与预测任务部分。
来源:X-Cell官方项目页。网络细节与本章实验需求测算关系较弱,可裁去。
2,560万是单细胞转录组数量,不能换算为定制蛋白数量,也不能与binder送检数量直接比较。
Xaira将可开发性纳入早期筛选,结合命中只是候选评价的起点
Xaira提出“Progressable Binder”评价框架,在结合能力之外,同时考察表达、热稳定性、单体比例及非特异性。能够结合靶点,并不代表分子已具备后续开发条件。(Xaira Therapeutics)
公司披露的内部参考要求包括早期亲和力约100 nM或更优、单体比例不低于90%等。通过初筛的候选仍需开展功能及后续药物属性评价,实验内容随研发推进而增加。(Xaira Therapeutics)
表名改为:Xaira早期候选筛选的部分评价维度
| 评价维度 | 公司披露的参考要求 | 主要目的 |
|---|---|---|
| 结合能力 | 早期亲和力约100 nM或更优 | 确认靶点结合 |
| 表达 | 高通量哺乳动物表达体系评价 | 判断制备可行性 |
| 热稳定性 | 按Fab、VHH等分子类型设置要求 | 筛除稳定性不足的候选 |
| 单体比例 | SEC单体比例不低于90% | 识别聚集风险 |
| 非特异性及功能 | 按项目开展相关实验 | 判断结合质量及生物学作用 |
替换原通用研发循环表述,使用候选推进图。
来源:Xaira:Progressable Binders,Figure 2,De novo design hit-to-lead progression。该图直接说明结合命中之后仍需哪些筛选,比重复介绍RF工具更贴近后半章主线。
上述阈值为Xaira披露的内部评价框架,不是通用行业标准。
Chai-1侧重结构预测,Chai-2/3拓展分子设计与药企合作
Chai-1用于多分子复合物结构预测,Chai-2则根据靶点和表位直接设计抗体、纳米抗体及miniprotein。两代模型解决的问题不同,不能仅用同一项结构预测指标评价。(Chai Assets)
2026年披露的Chai-3开始通过药企合作进入研发流程。公司称其抗体设计成功率较Chai-2提高,但完整实验分母和统一比较数据尚未随相关公告披露。(Business Wire)
| 模型 | 首次公开 | 主要任务 | 已公开的验证内容 |
|---|---|---|---|
| Chai-1 | 2024年9月 | 多分子复合物结构预测 | 结构预测计算基准 |
| Chai-2 | 2025年6月 | 表位导向的de novo分子设计 | 多靶点结合、结构及部分功能实验 |
| Chai-3 | 2026年6月 | 面向药企研发的下一代设计模型 | 公司称成功率约为Chai-2的2倍;完整可比数据未披露 |
保留代际对比表。 删除长篇创始人履历和融资估值,不另加公司宣传图。
“成功率约2倍”属于公司披露,不能直接将Chai-2的16%乘以2,写成Chai-3的统一命中率。
Chai-2已完成多靶点湿实验,不同研究批次需分别统计
Chai-2根据靶点及表位生成候选,再通过表达、结合及结构实验验证。首轮抗体及纳米抗体研究覆盖52个靶点,每靶点最多送检20条设计,约一半靶点获得至少一个命中。(Chai Discovery)
后续全长IgG和GPCR研究扩大了评价范围,但采用了不同的样本和送检规模。可开发性及功能结果应与首轮命中率分开呈现,不能统一套用“每靶点不超过20条”。(Chai Discovery)
| 研究批次 | 样本或送检口径 | 主要结果 |
|---|---|---|
| 首轮抗体及纳米抗体研究 | 52个靶点;每靶点最多20条 | 候选级命中率约16%;约半数靶点获得命中 |
| miniprotein研究 | 与抗体研究分开统计 | 候选级命中率约68% |
| 后续全长IgG评价 | 88个设计,覆盖28个抗原 | 86%的设计仅出现0–1项可开发性风险提示 |
| 后续GPCR研究 | 6个靶点;每靶点10–73条 | 6个靶点均获得binder |
保留现有design→wet lab流程图。
来源:Chai-2发布说明。图下注明“首轮研究流程”;后续IgG及GPCR结果放入独立表格,不混在同一实验分母下。
“52个此前没有已知抗体的靶点”建议改为“52个在SAbDab中缺乏相应已知抗体结合信息的靶点”。数据库缺少记录,不等于文献及产业界不存在相关抗体。
ESM体系覆盖表征、生成与结构预测,各工具承担不同任务
ESM3联合处理蛋白序列、结构和功能信息,用于条件生成;ESM C侧重序列表征,ESMFold2用于结构及复合物预测。三者并非简单的前后替代关系。(EvolutionaryScale)
Biohub继续扩展相关模型及ESM Atlas数据资源,为候选生成、结构评估和蛋白检索提供工具。对湿实验的影响,应结合实际设计与验证流程判断,而非按模型名称排列代际。(Biohub)
| 工具 | 主要任务 | 典型输出 |
|---|---|---|
| ESM3 | 序列、结构和功能条件生成 | 满足给定约束的蛋白设计 |
| ESM C | 蛋白序列表征 | 用于下游预测及分析的模型表征 |
| ESMFold2 | 蛋白及复合物结构预测 | 三维结构及相关置信度 |
| ESM Atlas | 蛋白数据组织与检索 | 序列、预测结构及关联信息 |
保留对比表。 不画“ESM3→ESM C→ESMFold2”的单向升级箭头。
ESM Atlas收录的数据规模,不应直接作为某一模型的训练数据量。
ESM3通过两轮实验获得esmGFP,计算设计仍需功能结果筛选
esmGFP研究使用ESM3的7B版本,根据GFP部分结构约束生成并筛选候选。团队先后开展两轮96孔板实验,并利用首轮结果选择后续设计起点,最终获得具有荧光功能的esmGFP。(U-M Personal Web Server)
esmGFP与最接近的已知荧光蛋白序列一致性约58%;在论文设定的检测条件下,其亮度处于所测天然荧光蛋白的范围内。该结果同时依赖计算筛选与真实功能测定。(U-M Personal Web Server)
图名改为:esmGFP设计与两轮功能验证
流程文字:
结构约束 → 计算生成与筛选 → 首轮96孔板实验 → 选择后续设计起点 → 第二轮96孔板实验 → esmGFP
图下注:
96孔板包含对照,不等于每轮合成96条新设计。两轮实验也不等于两轮模型重新训练。
替换现有大幅模型架构图,使用实验结果图。
来源:Science原始论文,Figure 4B–C,优先保留两轮孔板及荧光亮度比较。它比架构图更直接回答“生成以后实际做了多少实验”。
正式论文首轮为88个设计,96孔板还包含对照。删除“两轮各96个候选”及“192条新设计”的写法;“58%”对应最接近的已知蛋白,不应改写为最接近的天然蛋白。(U-M Personal Web Server)
ESMFold2支持五靶点binder设计,部分候选已开展细胞功能验证
Biohub利用ESMFold2支持的设计流程,在EGFR、PDGFRβ、PD-L1、CTLA-4及CD45五个靶点获得实验确认的binder。公告披露,minibinder候选级命中率为36%–88%,抗体衍生scFv为15%–29%。(Biohub)
部分PD-L1候选还开展了T细胞信号相关功能实验。结合命中和功能结果应分层展示,不能仅以最佳亲和力代表全部候选质量。(Biohub)
保留两个信息框:
结合验证:五个靶点均获得binder
功能验证:部分PD-L1候选开展T细胞信号相关实验
删除正文、图旁及下方对同一命中率的三次重复。代表性Kd保留在原图中,不再另列五个大号数值。
保留现有命中率及结合实验图。
来源:Biohub官方研究说明。
所引公司公告未列完整的逐靶点送检分母。补齐原始实验表之前,不将这些百分比用于跨平台排名;也不再写“验证仅限结合”。
AlphaFold扩展复合物预测范围,Isomorphic将相关能力用于药物设计
AlphaFold 2主要预测蛋白结构,AlphaFold 3将范围扩展至蛋白与配体、核酸等多分子复合物。预测对象增加,不等于模型已直接完成新蛋白序列的de novo设计。(Nature)
Isomorphic Labs在此基础上开发IsoDDE,将结构、结合口袋及亲和力评估用于候选筛选和优化。相关计算结果能够辅助实验决策,但不能替代真实结合及药效验证。(Google Cloud Storage)
改为三阶段对照:
| 技术 | 主要任务 | 与实验的关系 |
|---|---|---|
| AlphaFold 2 | 蛋白结构预测 | 提供结构假设 |
| AlphaFold 3 | 多分子复合物结构预测 | 支持相互作用与结合构象分析 |
| IsoDDE | 结构、口袋及亲和力评估 | 辅助候选筛选与优化 |
替换:自行重绘上述三阶段示意图。
依据:AlphaFold 3原始论文及IsoDDE技术报告。现有AF3网络结构图过于技术化,不能直接说明其与湿实验的关系。
删除未经项目明细支持的统一IND时间表及估值判断。
IsoDDE整合结构、口袋与亲和力预测,公开结果主要来自计算基准
IsoDDE将复合物结构预测、潜在结合口袋识别及亲和力评估纳入同一设计流程,用于候选排序和分子优化。其作用是帮助决定哪些候选值得进入后续合成与实验。(Google Cloud Storage)
当前技术报告主要展示结构泛化、口袋识别及亲和力预测等基准结果。这些指标与真实项目的合成成功率、结合命中率及药效成功率不同,不宜互相替代。
三幅子图标题统一为:
结构预测:未见体系的泛化表现
口袋识别:潜在结合位点识别能力
亲和力预测:预测值与实验值的一致性
删除“计算表现提升直接减少多少湿实验”等未经项目数据支持的结论。
保留原技术报告Figure 1,删除第二张Cereblon案例图。
来源:IsoDDE技术报告,Figure 1。一页保留一组总览指标,比叠加多个案例更清楚。
本页没有可用于实验需求测算的完整送检分母,不据此估算节省的合成数量。
binder命中率受送检分母与实验条件影响,跨项目比较需统一口径
候选级命中率以进入指定实验的设计为分母,靶点级命中率则统计是否至少获得一个binder。计算生成量不能替代湿实验分母,未表达和质控失败如何计入,也需说明。
每靶点送检量、靶点构象、检测方法及命中阈值均会影响结果。比较时应同时保留失败靶点和验证方,不能仅按一个百分比排序。AlphaProteo的TNFα实验为0/54,不能从总体评价中略去。(arXiv)
表名改为:代表性binder项目的实验分母与验证口径
| 项目或实验组 | 候选级命中率 | 送检口径 | 靶点数 | 验证与统计方式 |
|---|---|---|---|---|
| Anthropic多靶点:Mythos Preview | 26.7%,104/390 | 每靶点30条 | 13 | 两家外部CRO实验,研究团队按规则汇总 |
| Anthropic多靶点:Opus 4.8 | 22.6%,88/390 | 每靶点30条 | 13 | 同上 |
| Anthropic单靶点:Mythos Preview | 35.1%,158/450 | 每靶点30条 | 15 | 单靶点集中计算资源的实验组 |
| Chai-2首轮抗体及纳米抗体 | 约16% | 每靶点最多20条 | 52 | 公司团队研究,体外结合评价 |
| AlphaProteo | 0%–88% | Table 1为每靶点54–172条 | 8 | 研究团队实验;包含TNFα失败结果 |
| ESMFold2 minibinder | 36%–88% | 所引公告未列完整逐靶点分母 | 5 | Biohub披露,体外结合实验 |
Anthropic三行是选列实验组,不构成整个项目的完整汇总。(Anthropic)
保留对照表,不新增柱状排名图。 不同实验口径不适合排列成统一“模型成功率榜单”。
删除原页“每个模型均约88条/靶点”的写法;1,320÷15只是项目汇总平均值。删除“命中率提升并不减少湿实验总量”,需求讨论移至P43。
训练投入披露程度不一,ESM3已公开参数、数据及计算量
ESM3披露了参数规模、训练步数和FLOPs;Chai-1与AlphaFold 3披露了GPU及训练时长。Chai-2/3的训练细节仍较有限,现有资料不足以建立统一的“训练投入—设计成功率”关系。(Rivista AI)
训练步数是模型参数更新的次数,不是计算设计轮次或湿实验轮次。下表只列训练信息,不混入候选生成量、孔板数量和实验命中率。
删除“验证结果”列,将模型压缩至本章三条主线。
| 模型 | 参数规模 | 训练计算与时长 | Training steps | 训练数据来源与规模 |
|---|---|---|---|---|
| ESM3 | 1.4B/7B/98B版本 | 最大版本约1.07×10²⁴ FLOPs | 最大版本约43万步 | UniRef、MGnify、JGI等;约27.8亿条序列、7,710亿语料token,并加入结构及功能信息 |
| Chai-1 | 模型总参数未披露 | 128块A100,约30天 | 未披露 | PDB及AlphaFold DB;完整去重训练量未披露 |
| Chai-2 | 未披露 | 未披露 | 未披露 | 未披露 |
| Chai-3 | 未披露 | 未披露 | 未披露 | 未披露 |
| AlphaFold 3 | 未披露 | 256块A100;四阶段约10/3/5/2天;FLOPs未披露 | 未直接列示 | PDB实验结构及蒸馏数据;完整去重训练量未披露 |
表下注:按所引原始论文及官方资料列示,不根据模型表现反推参数或训练规模。(Rivista AI)
保留训练信息表,不叠加架构图。
原始核对资料:ESM3论文及补充材料,Table S1;Chai-1技术报告;AlphaFold 3论文的补充材料Table 6。
Chai-1使用的30亿参数蛋白语言模型是嵌入模块,不是Chai-1总参数量。ESM3约7,710亿语料token与训练累计处理约1.8万亿token不是同一口径。原稿AF3“训练计算未披露”应更正。
ESM与Chai扩展生成设计,AlphaFold主要拓展复合物预测范围
三条技术路线的代际变化并不相同:ESM增加结构和功能条件生成,Chai从结构预测扩展至分子设计,AlphaFold则扩大可预测的分子类型。不能将三者概括为同一条“参数增加、命中率上升”的路径。(EvolutionaryScale)
验证方式也应随任务区分。生成模型需要证明新设计能够表达并具有预期功能;结构预测模型主要评价预测准确性。是否增加湿实验,应结合设计任务及候选推进情况判断。
表名改为:三条模型路线的训练、任务与验证变化
| 模型路线 | 训练侧变化 | 设计或预测任务变化 | 验证侧变化 |
|---|---|---|---|
| ESM2→ESM3 | 最大版本约15B→98B;增加结构和功能信息 | 序列表征扩展至多信息条件生成 | ESM3开展荧光蛋白制备及功能测定 |
| Chai-1→Chai-2→Chai-3 | 缺少统一披露的代际训练数据 | 复合物预测→表位导向设计→药企研发应用扩展 | Chai-1以计算基准为主;Chai-2已有多靶点实验;Chai-3完整可比结果未披露 |
| AF2→AF3 | 扩展分子类型及相应训练数据 | 蛋白结构预测→多分子复合物预测 | 主要比较结构预测基准,不等于新序列的湿实验验证 |
ESM2最大参数规模依据官方模型清单;其余信息分别对应相关论文及公司公告。(GitHub)
替换为自行重绘的三行对照图。 每行固定“训练侧—任务侧—验证侧”,不再叠加ESMFold2的详细命中率。
删除“ESM2约5,000万条→ESM3约27.8亿条”的直接倍数比较;聚类代表序列与完整语料的统计方式不同。也不再将ESM C、ESMFold2画成ESM3的直接下一代。
计算候选进入实验后,外部平台承接DNA、蛋白制备与检测
Anthropic案例将计算设计与实验执行分开:模型负责提出和筛选候选,外部平台负责实体制备、表达及结合检测。候选能否表达、是否结合,仍需由实验给出答案。(anthropic.com)
Adaptyv侧重标准化的序列到数据服务,Twist覆盖DNA合成及蛋白实验,金斯瑞则提供基因至蛋白及抗体服务。三类平台的承接环节存在重叠,但服务组织方式不同。(Adaptyv Bio)
表名改为:AI蛋白设计后的主要实验承接方式
| 平台 | 主要承接环节 | 交付内容 | 与Anthropic案例的关系 |
|---|---|---|---|
| Adaptyv Bio | DNA供应衔接、无细胞表达、结合检测 | 表达状态及结构化结合数据 | 官方报告列示的实验平台 |
| Twist | DNA合成、哺乳动物表达及蛋白表征 | 蛋白样品、结合、表达及纯度数据 | 官方报告列示的实验平台 |
| GenScript | 基因合成、蛋白及抗体表达、纯化与分析 | 基因至蛋白的定制交付 | 未列为该项目的直接实验平台 |
替换为两家实验平台的原始流程图。
来源:Anthropic技术报告,Figure M3A,PDF第8页。该图可直接说明Adaptyv与Twist采用不同表达及检测方案,比市值、收入横向表更适合作为产业链过渡页。
不再放市值及年度收入。Adaptyv衔接DNA供应,不等于其自行完成全部DNA制造。
Twist在三周内完成1,260条设计评估,服务已覆盖蛋白制备与表征
在Anthropic项目中,Twist采用HEK293体系表达Fc融合蛋白,并在不到三周内完成1,260条设计的生产及独立评估。交付内容已超出DNA合成,覆盖蛋白制备和实验表征。(Twist Bioscience)
实验包括高通量SPR、表达滴度及分析型SEC,可同时提供结合、表达和样品质量信息。客户获得的不只是实体分子,还包括用于后续筛选的数据。(Twist Bioscience)
| 环节 | Twist在项目中的工作 | 主要输出 |
|---|---|---|
| 蛋白制备 | HEK293表达Fc融合蛋白 | 可供检测的蛋白样品 |
| 结合表征 | 高通量SPR | 结合实验数据 |
| 表达评价 | 滴度测定 | 表达水平 |
| 样品质量 | 分析型SEC | 单体及聚集相关信息 |
将原大号文字改为:
1,260条设计:蛋白生产与独立评估
交付周期:不到三周
保留项目表,删除重复的总体命中率图。
来源:Twist官方项目说明。
1,260条是Twist评估口径,不与Adaptyv数量相加。删除“DNA合成与蛋白解决方案分别占49%和51%”:原业务分类中二者属于同一组合,另一类是NGS。
Adaptyv以自动化实验承接设计序列,交付表达与结合数据
Adaptyv面向客户提供从序列提交、DNA供应衔接、无细胞表达,到结合检测及数据交付的标准化服务。模型团队无需自建完整实验流程,也可获得候选的真实实验结果。(Adaptyv Bio)
Anthropic项目中,Adaptyv对1,320条设计返回1,296条状态记录,包括336条结合、899条未结合及61条未表达;另有24条未返回结果。不同失败类型可为后续筛选提供不同信息。(Anthropic)
当前常规服务覆盖24–768条批次,标准方案包含2个重复,产品页列示周期为3–4周。更大项目需单独确认实验方案、报价与排期。(Adaptyv Bio)
表名改为:Adaptyv从序列到实验数据的交付内容
| 服务步骤 | 主要交付内容 |
|---|---|
| 序列接收与DNA准备 | 可进入表达流程的构建材料 |
| 无细胞表达 | 表达样品及表达状态 |
| 结合筛选 | 结合判定及相关实验曲线 |
| 数据质控与交付 | 序列关联的结果、异常标记及结构化数据 |
删除融资金额及大号报价,本页集中讲能力;价格统一放P43。
替换为自行重绘的流程图:
序列 → DNA准备 → 无细胞表达 → SPR/BLI → 质控与结构化数据
依据:Adaptyv官方项目复盘。比泛化的自动化平台介绍图更容易看清实际交付内容。
1,296条是有状态记录的设计,不是1,296条均完成有效结合测定。基础结合筛选与完整亲和力动力学测定应分开表述。
Twist依托硅芯片开展并行DNA合成,基因交付已达年百万条附近
Twist通过硅芯片实现高密度并行DNA合成。公司披露,平台在满规模条件下单芯片可合成超过100万条寡核苷酸,约对应9,600条基因组装,为多序列并行构建提供制造能力。(Twist Bioscience)
FY2025公司交付约93.8万条基因,同比增长22%。该指标反映实际基因交付规模,但不能直接代表蛋白表达数量或下游检测产能。(Twist Bioscience)
| 指标 | 公司披露值 | 口径 |
|---|---|---|
| 单芯片寡核苷酸规模 | 超100万条 | 平台技术能力 |
| 单芯片基因组装规模 | 约9,600条 | 满规模条件下的平台口径 |
| FY2025基因交付 | 约93.8万条 | 实际年度交付量 |
| 基因交付同比增长 | 22% | FY2025较FY2024 |
替换为Twist官方硅芯片并行合成示意图,将P40的工艺图移至本页。
来源:Twist Technology,网页中的传统合成与硅芯片合成对比图,无统一Figure编号。该图直接支持本页的并行制造能力判断。
不将“寡核苷酸条数”“组装基因条数”和“表达蛋白数量”混用。公开技术能力也不等于实际产能利用率。
Twist季度收入增长23%,DNA合成及蛋白相关业务增速较快
FY2026第三季度,Twist收入1.184亿美元,同比增长23%。其中,DNA合成及蛋白解决方案收入同比增长39%,高于NGS应用的12%。(Securities and Exchange Commission)
公司将全年收入指引上调至4.56–4.57亿美元。上述增长体现整体业务表现,现有披露尚不足以单独测算AI蛋白设计的收入贡献。(Securities and Exchange Commission)
表名改为:Twist FY2026第三季度收入及全年指引
| 项目 | 收入 | 同比 |
|---|---|---|
| DNA合成及蛋白解决方案 | 5,660万美元 | +39% |
| NGS应用 | 6,180万美元 | +12% |
| 公司合计 | 1.184亿美元 | +23% |
| FY2026全年收入指引 | 4.56–4.57亿美元 | 指引,非实际完成值 |
替换:按最新业绩公告自行重绘两类业务收入及增速。
来源:Twist FY2026第三季度业绩公告。本页不再放芯片工艺图。
删除“资本开支显著收缩”:原稿将全年与单季度数据比较,不能支持该结论。其他页面如保留FY2025收入,应使用约3.766亿美元,而非3.776亿美元。(Twist Bioscience)
金斯瑞Gene-to-Protein占生命科学收入66%,AI相关业务保持增长
金斯瑞生命科学业务覆盖基因合成、蛋白及抗体表达、纯化与分析。TurboCHO公开标示日通量超过1,000个抗体,具备承接多候选并行制备的服务基础。(GenScript)
2026年上半年,Gene-to-Protein约占生命科学业务收入的66%,AI药物发现相关收入同比翻倍;后者绝对规模尚未单独披露。(GenScript)
ESM3补充材料披露,GenScript曾承担esmGFP及对照的独立复现实验,已有蛋白生成项目的实验服务记录。该案例比单纯比较市值,更能说明其与AI蛋白设计的业务联系。(Rivista AI)
表名改为:Twist与金斯瑞生命科学业务的服务侧重
| 比较维度 | Twist | 金斯瑞生命科学业务 |
|---|---|---|
| DNA环节 | 硅芯片高密度并行合成 | 基因合成及相关构建服务 |
| 蛋白环节 | 蛋白制备、抗体发现及表征服务 | 多表达体系、蛋白及抗体制备 |
| 检测环节 | 结合、表达及样品质量评价 | 纯化、质量分析及可选表征服务 |
| 本章观察重点 | DNA订单与蛋白服务延伸 | Gene-to-Protein及AI相关客户需求 |
保留能力对照表,删除市值及未经统一口径核验的市场份额。
需要补充小图时,可使用TurboCHO官方平台资料中的基因至表达、纯化流程图,不再增加集团业务全景图。
“超过1,000个抗体/日”为平台能力,不是实际日订单或利用率。GenScript参与的是esmGFP相关独立复现实验,不应写成承接ESM3全部两轮实验。
公开数据库提供通用信息,具体候选的实验表现仍需逐一确认
PDB、UniRef、MGnify、AFDB及OAS提供结构、序列或抗体信息,可用于模型训练与方法开发。其中,预测结构与实验结构属于不同证据类型,不能互相替代。(AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx)
具体候选能否表达、是否结合、是否具有功能及可开发性,仍需在明确条件下验证。未表达、未结合与检测失败应分别记录,避免将技术失败误作生物学阴性。(Anthropic)
实验增量应同时包含序列、结果、实验条件及质量标记。经授权后,这些数据可用于候选筛选、下一轮设计及模型迭代。
| 数据类别 | 代表内容 | 能够提供什么 | 不能直接回答什么 |
|---|---|---|---|
| 公共序列 | UniRef、MGnify、OAS等 | 已观测序列及相关统计信息 | 新候选在指定条件下是否有效 |
| 公共结构 | PDB实验结构、AFDB预测结构 | 结构与相互作用分析依据 | 新设计是否表达、是否具有功能 |
| 项目实验标签 | 表达、结合、活性、特异性、可开发性 | 候选在具体条件下的真实表现 | 不经验证即跨条件外推的结果 |
| 实验元数据 | 条件、对照、重复、质控及失败原因 | 判断结果是否可用、可比较 | 缺失元数据时的可靠泛化 |
替换ESM3规模曲线,自行重绘“公共数据—项目实验数据”双栏图。
右栏突出:
表达成功/失败|结合/未结合|活性|特异性|可开发性|质控失败原因
实验服务商不当然拥有客户数据,也不当然有权跨客户用于训练。数据价值需与授权范围、质量及可复用性一并判断。
送检规模决定实验支出,万条候选对应约百万美元级基础结合筛选
百万级计算候选不等于百万级真实合成。ProGen曾生成约100万条序列,选择100条开展表达验证;公开项目也已出现跨靶点千条级送检,计算量与实验量仍相差较大。(Nature)
需求测算应从“项目数×靶点数×每靶每轮送检量×实验轮次”出发。命中率改善可能减少单项目所需候选,项目扩张及更多靶点尝试则可能增加总实验量。
按当前公开起价,1 kb DNA片段约70美元/条,基础sequence-to-binding服务为99美元/条起。以下按两种独立服务情景测算,不将其相加作为单条总成本。(Twist Bioscience)
表名改为:不同送检规模对应的实验支出量级参考
单位:万美元
| 送检规模 | DNA-only参考:1 kb片段,70美元/条 | 基础sequence-to-binding参考:99美元/条起 |
|---|---|---|
| 1,000条 | 7 | 9.9起 |
| 10,000条 | 70 | 99起 |
| 100,000条 | 700 | 990起 |
表下注释直接使用:
DNA情景假设每条1,000 bp,按0.07美元/bp计;sequence-to-binding情景按基础结合筛选公开起价计。按公开目录价线性外推,仅用于量级参考,不代表实际项目报价。未考虑规模折扣、税费及额外实验,两类服务范围存在重叠,不可相加。
表上方可增加一行:
实验需求量 ≈ 项目数 × 靶点数 × 每靶每轮送检量 × 实验轮次
保留情景测算表,自行重绘,不使用公司宣传图。
价格依据:Twist基因产品目录;Adaptyv结合筛选服务页。
原稿Adaptyv“149美元起”应更新为当前页面的“99美元起”。该起价对应基础结合筛选,不等于包含完整动力学、功能及可开发性评价。10万条仅为测算情景,不代表平台已公开的单批产能或交付承诺。
DNA只是候选构建起点,服务范围随表达和功能验证延伸
DNA交付后,候选仍需经过表达、纯化及质量控制,才能获得适合检测的蛋白样品。低表达、不可溶或聚集等问题,不能仅凭序列设计排除。(GenScript)
通过初筛的候选还需评价结合、功能及可开发性。随着候选逐层减少,单个入选分子的评价深度增加;服务内容也从DNA构建延伸至样品制备与多维表征。
删除公司报价,改为服务环节与交付物。
| 环节 | 主要交付物 | 解决的问题 |
|---|---|---|
| DNA合成 | 基因片段或构建载体 | 能否将设计序列实体化 |
| 蛋白表达 | 表达样品及产量记录 | 能否获得目标蛋白 |
| 纯化与QC | 纯化样品、纯度及单体信息 | 样品是否适合检测 |
| 结合表征 | SPR/BLI等结合数据 | 是否结合、结合表现如何 |
| 功能验证 | 生化或细胞功能结果 | 是否产生预期生物学作用 |
| 可开发性评价 | 稳定性、聚集及非特异性等结果 | 是否适合继续开发 |
替换为自行重绘的“候选筛选漏斗+服务环节”图。
上方标注:候选数量逐层减少
下方标注:单个入选候选的评价内容增加
不是所有候选都会经过全部六个环节。本页说明服务范围扩展,不据此判断各环节毛利率或单价高低。
定制蛋白服务涉及多环节协同,规模交付依赖流程稳定性
定制蛋白服务的进入要求不只在DNA合成。序列复杂度、表达体系、纯化方法及表征方案都会影响交付,需要相应的工艺积累和质量控制。(Twist Bioscience)
高通量项目还要求样品追踪、自动化排程、标准化实验和异常处理相互匹配。批次一致性、结果可追溯及交付周期,是评价平台规模化能力的重要维度。(Adaptyv Bio)
我们认为,稳定交付及与客户研发流程的衔接,有望增强平台客户粘性;仅凭设备数量或单次项目规模,尚不足以判断长期竞争优势。
表名改为:定制蛋白服务的主要能力要求及观察指标
| 环节 | 需要具备的能力 | 建议观察指标 |
|---|---|---|
| DNA合成与构建 | 并行合成、组装、错误校正及复杂序列处理 | 准确率、构建完成率、复杂片段交付 |
| 蛋白表达与纯化 | 表达体系选择、工艺适配及纯化流程 | 表达成功率、产量及批次一致性 |
| 质量与实验表征 | QC、SPR/BLI及功能实验的开发和执行 | 样品质量、对照表现、曲线质量及重测率 |
| 自动化与流程管理 | 样品追踪、排程、标准作业及异常处理 | 周期、交付一致性及可追溯性 |
| 数据交付与使用 | 序列关联、结构化结果、元数据及授权管理 | 数据完整性、可复用性及授权范围 |
保留能力矩阵,自行重绘。 删除各环节的重复报价、年度交付量和“后进入者追赶周期”。
表列指标为建议评估维度,不是各平台已披露的经营数据。删除“切换成本极高”“后进入者追赶以年计”等缺少证据的判断。
原因: 单一样品的NMR/LC-MS解析能说明数据处理能力,但与蛋白候选的合成、表达及结合需求联系较弱,也容易被误读为完整湿实验自动化。
建议: 正文保留P21蛋白设计案例;P22作为“科研数据分析应用”补充材料。
原因: X-Cell详细架构与定制蛋白需求不是同一问题。纪要更关注模型发展带来的下游需求,以及实验平台的能力和进入要求。(王云鹏语音任务纪要_20260901.md)
建议: P23保留“分子设计—扰动数据—实验筛选”三模块;将P24压缩为其中一个数据框。P25保留,用于说明binder之后仍需哪些评价。
原因: 两页均围绕结构、口袋和亲和力预测展开,单独展开容易使读者误以为这些基准可直接用于计算湿实验命中率。
建议: 合为一页,上半页说明AF2→AF3→IsoDDE的任务变化,下半页保留IsoDDE Figure 1,并明确“公开结果主要为计算基准”。
P19先区分海外平台的技术定位与验证内容,P20–P22再以Anthropic说明通用模型如何连接专业设计工具、外部实验和数据分析。
P23–P25介绍Xaira的模型、数据及药物研发体系,落点不是工具数量,而是结合命中之后仍需开展的表达、功能与可开发性评价。
P26–P27用Chai展示从结构预测到分子设计的任务变化,并把首轮命中率与后续IgG、GPCR实验分开统计。
P28–P30用ESM展示表征、生成和结构预测的分工,再以esmGFP和binder实验说明计算设计如何接受真实功能检验。
P31–P32补充AlphaFold与IsoDDE路线,明确结构和亲和力预测可以辅助筛选,但不能与真实送检命中率混为一谈。
P33先解决实验分母与可比性问题,P34再单独列训练投入,P35据此总结模型代际变化,避免把训练、计算设计和湿实验混在一起。
P36将讨论转向实验承接方,P37–P38分别说明Twist和Adaptyv实际完成了哪些制备、检测与数据交付工作。
P39–P40补充Twist的并行制造和经营规模,P41再以服务能力、已披露AI相关业务及实验案例连接金斯瑞。
P42解释公共数据库之外仍需新增哪些实验标签,P43据此用送检规模和独立价格情景估算需求量级,而不是把计算候选数直接当作订单量。
P44说明服务内容如何从DNA延伸至蛋白和功能评价,P45最终落到工艺、自动化、质控、数据交付和流程稳定性等多环节进入要求。