你是一名资深医药行业卖方分析师,同时也是券商行业报告PPT的主笔和审稿人。 附件包括: 1. 当...

생성일: 2026년 9월 6일

답변에 사용된 모델 GPT-6 Pro by Chat01

질문

AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx
王云鹏语音任务纪要_20260901.md

你是一名资深医药行业卖方分析师,同时也是券商行业报告PPT的主笔和审稿人。

附件包括:

  1. 当前版本PPT/PDF:
    《AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906》

  2. 《王云鹏 建投医药—2026-09-01语音任务纪要》

请先完整阅读两个附件。

你的最终任务不是写一篇研究报告,也不是输出长篇审稿意见,而是:

直接帮助我把这套P19-P45 PPT改到可以交稿的程度。

其中最重要的是:

逐页优化PPT标题和正文文案,使其更加像成熟的医药卖方行业报告,语言自然、书面、平实、数据驱动,不要有明显AI味。

其次才是:

  • 检查逻辑
  • 检查数据边界
  • 找真正有用的原始论文/公司资料配图
  • 提醒明显需要补的数据

==================================================
一、先理解整套PPT最终要讲什么

这套PPT不是泛泛介绍海外AI制药公司。

最终主线是:

蛋白大模型持续迭代
→ 参数量、训练数据和计算投入扩大
→ 模型由结构预测向de novo设计发展
→ 计算端可以更快生成和筛选大量候选
→ 真实候选仍需进入DNA合成、蛋白表达、纯化、SPR/BLI和功能验证
→ 湿实验形成真实表达、结合、活性、失败负样本等标签
→ 标签继续反馈模型迭代
→ AI设计规模扩大可能带动高通量湿实验需求增加
→ Twist、Adaptyv Bio、GenScript等平台成为这一需求的承接方
→ 进一步判断定制蛋白服务的产能、价值量和进入壁垒

领导最关心的不是“AI模型有多先进”,而是:

如果模型继续发展,未来会产生多少真实实验需求?
这些需求最终落在哪些产业链环节?
Twist、Adaptyv、金斯瑞为什么可能受益?

因此每一页都要服务于这条主线。

==================================================
二、你的第一优先级:直接修改PPT文案

请逐页审阅P19-P45。

对每一页都判断:

  • 当前页面想表达什么
  • 标题是否准确
  • 正文是否顺
  • 是否有AI味
  • 是否重复
  • 是否有结论过强
  • 是否值得保留
  • 是否应该压缩

最终重点不是“指出问题”,而是:

给我可以直接复制粘贴进PPT的最终文字。

==================================================
三、PPT文字风格

请严格采用中国医药券商卖方PPT的书面风格。

关键词:

书面、平实、克制、数字优先、逻辑清楚。

参考表达:

  • 从公开数据看
  • 从模型演进看
  • 从现有结果看
  • 公司披露
  • 论文显示
  • 相较上一代
  • 目前来看
  • 整体来看
  • 我们认为
  • 我们预计
  • 有望
  • 尚待进一步验证
  • 公开资料暂未披露
  • 不同项目之间不宜直接横向比较

避免宣传稿和AI稿风格。

不要频繁使用:

  • 核心
  • 赋能
  • 抓手
  • 底座
  • 重塑
  • 颠覆
  • 革命性
  • 新锐
  • 新兴力量
  • 差异化优势
  • 核心壁垒
  • 巨大潜力
  • 重要基础设施
  • 追赶以年计
  • 行业核心痛点

尤其减少以下典型AI句式:

“值得注意的是……”
“这意味着……”
“不仅……更……”
“由A走向B”
“进一步……进一步……进一步……”
“形成闭环”
“其核心在于……”
“这一案例充分说明……”

不是完全禁止,而是避免重复和机械套用。

==================================================
四、PPT标题规则

标题不要只是“公司介绍”或“技术介绍”。

尽量使用:

事实变化 + 结论

例如:

不要:
“Chai Discovery:AI分子设计新锐”

可以:
“Chai由结构预测向de novo设计迭代,Chai-2已完成多靶点湿实验验证”

不要:
“Xaira:AI驱动药物发现的新兴力量”

可以:
“Xaira整合模型、扰动数据与湿实验,推进端到端药物发现”

不要:
“行业壁垒分析”

可以:
“规模化合成、表达与表征形成多环节进入要求”

标题应尽量让读者只看标题就理解这一页的结论。

==================================================
五、PPT正文规则

当前PPT多数页使用2-3条正文,原则上保持。

推荐结构:

第一段

背景 / 技术变化 / 公司定位

第二段

最重要的数字证据

第三段

产业意义 / 边界 / 投资含义

但不要机械三段式。

如果两段已经说清,就只留两段。

正文长度原则:

  • 不得比原文明显更长
  • 原页过密时压缩15%-30%
  • 一页只讲一个中心问题
  • 相同数字不要在三四页反复出现
  • 数据能说明问题时,不再加形容词

一句话里尽量只表达一个主逻辑。

优先保证中文通顺。

==================================================
六、特别注意“AI味”

请把每一页当作真正要交给卖方首席审稿的PPT处理。

尤其检查:

  1. 主谓宾是否完整
  2. 句子是否过长
  3. 是否存在空泛判断
  4. 是否先给结论再堆事实
  5. 两条bullet是不是实际上在重复
  6. 是否连续使用“进一步”“逐步”“核心”
  7. 是否存在强行拔高的投资结论
  8. 是否像新闻稿,而不像研报
  9. 是否夹杂太多没有必要的英文
  10. 是否存在中文读起来明显像机器生成的句子

专业名词可以保留:

de novo
binder
hit rate
SPR/BLI
FLOPs
token
DBTL
ProteinMPNN
RFdiffusion

但普通表达优先中文。

==================================================
七、必须区分三个概念

现有PPT涉及大量“训练、生成、实验”的数字。

请始终严格区分:

1. 模型训练

training data
training steps
GPU
FLOPs
参数量

2. 计算设计

计算生成多少候选
in silico筛选多少候选

3. 湿实验

真正合成多少
表达多少
测试多少
做了几轮
获得多少binder
hit rate多少

不得混写。

比如:

ESM3的约430K steps
是模型训练步数;

esmGFP两轮各96个候选
是实验设计和筛选轮次;

两者不是同一个概念。

==================================================
八、重点优化P33-P45逻辑

请特别认真处理以下页面。

P33

回答:

不同de novo binder项目的hit rate为什么不能直接比较?

重点保留:

  • 分母
  • 每靶点送检量
  • 靶点难度
  • 失败靶点
  • 验证方

不要承担太多产业链结论。


P34

回答:

蛋白模型训练到底用了多少参数、数据和计算量?

重点:

  • 参数
  • FLOPs/GPU
  • training steps
  • 数据来源
  • 数据量
  • 是否公开

查不到就写:

“未披露”

不要推测。


P35

这是重要页面。

回答:

Chai、ESM、AlphaFold不同代际究竟发生了什么变化?

建议围绕三个维度:

训练侧
→ 参数/数据/模态

设计侧
→ 从预测走向生成

验证侧
→ 从benchmark走向真实湿实验

重点把:

ESM2→ESM3
Chai-1→Chai-2→Chai-3
AF2→AF3

写清楚。

标题和正文请重新优化,避免“训练数据扩容、湿实验随之加码”这种因果过强的说法。


P36-P41

这一组是:

AI模型设计以后,谁来完成build和test?

重点串联:

Anthropic
→ Adaptyv
→ Twist
→ GenScript

检查:

  • 页面是否重复
  • Twist公司介绍是否过长
  • 哪些数字只需要出现一次
  • Adaptyv是否突出得不够
  • 金斯瑞对标是否自然

P42

不要再重复P34的ESM3训练数字。

本页应该回答:

公开训练数据大家都能拿到以后,什么数据仍然需要自己生成?

重点:

公共数据:
PDB / UniRef / MGnify / AFDB / OAS等

vs

实验标签:
表达成功/失败
binding
activity
specificity
developability
negative data

标题和正文都请围绕这个问题重写。


P43

这是整个后半章最重要的一页之一。

它要回答:

AI设计规模扩大,到底可能产生多少实验需求?

请把逻辑写清楚:

百万级计算候选

百万级真实合成

但现实湿实验已经从:

几十条
→ 百条
→ 千条

发展。

需要通过公开价格做一个简单scenario。

注意:

Twist:
DNA-only价格

Adaptyv:
sequence-to-binding价格

两者服务范围不同。

不得简单相加后称为单条总成本。

建议用独立情景:

  • DNA-only参考
  • sequence-to-binding参考

例如可以考虑:

1,000条
10,000条
100,000条

分别对应大致数量级。

必须注明:

“按公开目录价线性外推,仅用于量级参考,不代表实际项目报价。”

这一页文字要非常像卖方PPT,
不要像学术论文。


P44

不要再次罗列公司报价。

应该回答:

为什么DNA合成只是起点,价值量会继续向蛋白表达与功能表征延伸?

逻辑:

DNA synthesis
→ protein expression
→ purification/QC
→ binding
→ function
→ developability


P45

回答:

为什么定制蛋白服务并非只有一台合成仪就能进入?

重点:

  • 高通量DNA synthesis
  • 错误校正
  • 蛋白表达体系
  • purification
  • QC
  • SPR/BLI
  • functional assay
  • automation
  • standardized workflow
  • structured experimental data
  • delivery consistency

结论要克制。

不要无证据写:

“后进入者追赶以年计”
“切换成本极高”
“单位成本显著更高”

更建议写:

“形成多环节进入要求”
“对规模化交付和流程稳定性提出较高要求”
“有望增强头部平台客户粘性”

==================================================
九、配图也以PPT最终效果为目标

不要单独做一份长篇“图片研究报告”。

只告诉我:

哪一页现有图不够好,以及应该换成什么图。

优先找:

  1. 原始论文figure
  2. 官方技术报告
  3. 公司官网技术图
  4. Investor presentation
  5. 10-K/财报

每个建议最多写:

页码
图名称
来源
Figure/Panel
链接
为什么比现在好

重点找以下类型:

  • ESM3模型规模/训练数据图
  • esmGFP两轮96候选实验图
  • Chai-2 design→wet lab流程
  • Anthropic minibinder workflow
  • Adaptyv sequence→DNA→expression→SPR/BLI流程
  • Twist silicon DNA synthesis平台
  • DNA→protein→binding/function漏斗

如果没有合适原始图,
直接建议“自行重绘”。

不要找stock image。

==================================================
十、最终输出形式

请不要输出大段行业研究报告。

我要的是一个:

PPT逐页修改稿

严格按下面格式。

==================================================

P19

建议标题

XXX

建议正文

 XXX

 XXX

 XXX

表格/图中文字建议

XXX

保留 / 替换 / 新增

如替换:
原始来源+链接

备注

只写真正需要核验的数据。

==================================================

一直做到P45。

然后再输出:

建议合并/删除的页面

只写确实值得调整的页面。

格式:

PXX + PXX
原因:
建议:

==================================================

最后输出:

P19-P45最终故事线

用8-12句话把整套PPT串起来。

不是写文章,
而是告诉我:

每一页为什么接下一页。

例如:

P33解决hit rate口径问题

P34回答模型训练投入

P35回答模型代际变化

P36开始进入真实实验链条

……

P43把实验量转为需求量级

P44解释价值量分布

P45落到供应链进入要求。

==================================================
十一、最终标准

最后请重新读一遍你修改后的全部P19-P45。

判断标准只有一个:

如果这是中信建投医药正式行业报告PPT,文字是否自然、可信、克制、通顺,并且每一页都有存在的理由?

如果某一句读起来像AI写的,
继续改。

如果一个词删掉不影响信息,
优先删除。

如果一句话没有数字、事实或逻辑作用,
优先删除。

不要为了“高级”而复杂化表达。

不要重新做一个Word报告。

最终输出必须以:

可直接复制进PPT

为标准。

사고

Pulling together insights

I’m gathering info on verifying citations, piecing together contemporary sources, and creating a sheer end text without obstructions or preambles.

Managing webpage citations

OK, let's simplify: Track word counts across web pages. Analyze Chinese segments, balance sources, and shape concise, attribute rich final output.

Mapping budget progress

OK, let me see: verifying 27 slides, estimating 45 minutes. Managing time effectively and reading PDFs through the API is essential.

Focusing on content

I’m organizing 27 focused pages with concise bullet points and detailed sections, ensuring clarity and reducing excessive details or finance specifics.

Assessing verification methods

Evaluating citation-based verification to avoid unsafe biotechnologies while integrating initial datasets.

Managing budget effectively
I’m thinking through how to manage a large budget without over-utilizing it, ensuring quality on each page and possibly reducing the word count.

Navigating personal growth

Hmm, I'm thinking about maintaining focus without getting overwhelmed by too many sources. With 45 sources available, time management and thoroughness are key. 뒤를 보니, examining contact sheets and ensuring accuracy with the latest technical evidence, such as updates on the Chai-2 paper and biorxiv links, are critical.

Organizing sections

I’m focusing first on refining sections by removing experimental elements and adjusting tech categories and timelines. This involves verifying data counts and ensuring clarity across all sections.

Charting structural models

OK, let me see. I'm narrowing down to 30k tokens, focusing on clear data and refining the panel's labeling.

Gathering info

I’m gathering URLs, reports, and primary sources. Parsing existing data and validating with primary URLs for accuracy.

Taking a closer look
I’m piecing together public PDF retrieval using containers and Python's requests and BeautifulSoup. It’s interesting to see how careful handling of potential 403 errors could streamline link extraction.

Verifying the document

OK, let me see. I’m checking the arXiv HTML of paper 2407.07135.

Redirecting strategy

Trying to steer clear of fruitless ID guesses, I'm honing in on precise searches for better results. This streamlined approach should boost efficiency.

Laying out priorities

OK, let's think it through: As a team, we’re tackling token resets and cognitive systems together. Progress is steady, and we need to stay focused on top priorities.

Mapping out options

I'm exploring the ESM3 primary paper, analyzing its details via the evolutionaryscale website PDF and considering related scientific publications and blogs. This involves noting hyperlinks and understanding content constraints.

Clarifying training details

Correcting the AF3 report, ensuring precise training stages, and managing contradictory dates, while checking P34 columns for meticulous accuracy.

Confirming supplement relevance

I'm pulling together an ESM3 supplement to compare candidate courses, ensuring the original data's accuracy and relevance. This approach will provide a clearer, evidence-based outlook.

Mapping out strategy

I’m thinking through the budget reset to a fixed $10k. Ensuring the final budget is clearly defined for accessibility. Using original ESM blog links for API assets.

Gathering insights

I'm compiling resources to craft a clear and insightful summary. Progress is steady, examining each aspect with precision.

Pinpointing key insights

I'm piecing together the key takeaways and challenges in this review to create a detailed report on determining next steps.

Ensuring citations

Piecing together sources with precise measures, aiming for clarity and documentation. Progress on validating key stats.

Concluding the overview

Wrapping up the 16k Chinese summary, gathering critical feedback for final adjustments.

Ensuring structured content

I’m focusing on aligning the content with requirements, removing redundancy, and maintaining a concise, effective narrative.

Piecing together details

I'm assembling info on the ESM3 steps, managed through cached preprints and primary sources. Adjustments are considered if figures aren't validated.

Ensuring data accuracy

I’m working on finalizing the text by referencing verified sources and confirming the inclusion of all necessary remarks and tables. This process ensures the data's credibility and completeness.

Analyzing computational impact

I’m evaluating the computational effort required, ensuring not to reiterate previous points. Progressing through the analysis, I essentially abandoned generating numbers, focusing instead on maintaining clarity and relevance.

Evaluating cost structures

Thinking through the implications of DNA synthesis service costs, focusing on uncloned linear DNA and associated expenses. Progressing through additional steps to refine understanding.

P24Assessing XCell Sources
Piecing together official data, considering naturefig7 for ESM figures.

Consulting citations

I’m organizing citations to ensure specific pages from different sources are included, prioritizing primary citations as needed. This method ensures the final document is well-cited and well-organized.

Evaluating collaboration

I'm assessing Chai's expanding collaboration with drug companies, covering structural prediction and antibody design, aiming to streamline drug development.

Evaluating market potential

I'm thinking about the vast market potential of DNA and protein synthesis solutions, enhancing Twist's revenue growth, and strategizing company offerings in this dynamic field.

Verifying data accuracy

I'm comparing computed values with graphs and data tables, checking inconsistencies and averages. Progress is steady, ensuring thorough analysis.

Examining details

I’m mapping out the experiment selection process, including calibration steps and the volume linear relationship. Progress is being made on finalizing the figures and checking all headings for accuracy.

Assessing data accuracy

Piecing together the detailed data to ensure a scientifically fit structure, with a thorough review of all stage disclosures and totals.

Worked for 17m 28s

답변

P19–P45逐页修改稿

P19

建议标题

海外平台技术路线各有侧重,真实候选仍需经过实验筛选

建议正文

 海外平台分别从通用模型编排、蛋白生成、复合物预测及扰动数据建模切入。公司定位、分子类型和评价任务不同,不宜仅以参数规模或命中率比较研发能力。

 公开结果已覆盖结合、结构及部分功能验证,但这些结果并不等同于候选药物的体内药效、安全性或临床验证。本章重点比较模型输出如何进入实验,以及相关需求由哪些平台承接。(Anthropic)

表格/图中文字建议

表名改为:海外代表平台的技术定位与公开验证内容

平台技术定位主要研究对象本章引用的公开证据
Anthropic通用模型编排专业设计工具minibinder外部实验平台完成表达与结合检测
Xaira分子设计、扰动数据与药物研发结合蛋白、抗体及疾病生物学结合、可开发性评价及细胞扰动预测
Chai Discovery结构预测与生成式分子设计抗体、纳米抗体、miniprotein结合、结构及部分功能实验
ESM/Biohub团队蛋白表征、生成与结构预测功能蛋白、结合蛋白荧光功能、结合及部分细胞功能实验
Isomorphic Labs结构、口袋及亲和力预测小分子及生物分子复合物结构与亲和力等计算基准

表格不再列融资金额、市值及笼统的“有无自有管线”。(Xaira Therapeutics)

保留表格,不新增图片。 删除“验证深度趋同”等概括性图中文字。

备注

原页“尚无动物或临床数据”“仅Xaira推进自有管线”等表述,不宜用于概括五家公司的全部研发进展;表中应限定为“本章引用案例的公开证据”。(AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx)


P20

建议标题

Anthropic将Claude接入科研工具,应用范围扩展至蛋白设计与实验分析

建议正文

 Anthropic最初通过API额度支持科研项目,随后接入生命科学数据库、分析工具和计算资源。Claude在这一体系中主要承担任务规划、工具调用和结果整理,并非替代专业模型或实验设备。(Anthropic)

 2026年,公司推出Claude Science工作台,并披露蛋白设计与外部湿实验验证案例。其与本章相关的进展,是将计算设计、实验委托及数据分析衔接起来。(Anthropic)

表格/图中文字建议

将原九行时间表压缩为四行。

时间主要进展与蛋白设计相关的作用
2025年5月推出AI for Science项目提供模型访问与科研支持
2025年10月发布Claude for Life Sciences接入生命科学数据库及专业工具
2026年6月推出Claude Science工作台整合文献、代码、模型及算力
2026年8月披露蛋白设计实验结果计算候选进入外部制备与结合检测

保留时间轴,删除外围合作事项。 盖茨基金会合作、罕见病计划及招聘信息不再占用本页。

备注


P21

建议标题

Claude编排专业模型完成蛋白设计,15个靶点中14个获得binder

建议正文

 Claude负责选择设计策略、调用专业模型并筛选计算候选。多靶点任务自主运行48小时,计算预算上限为12,500 H100 GPU-hours;该数值属于设计阶段的推理预算,不是模型训练投入。(anthropic.com)

 纳入最终分析的1,320条设计中,共获得354个binder,候选级命中率为26.8%,15个靶点中14个获得命中。蛋白制备及检测由Adaptyv Bio和Twist完成,结果按研究预设规则汇总。(anthropic.com)

表格/图中文字建议

图名改为:Claude蛋白设计实验:各靶点命中结果及送检分母

流程文字统一为:

任务设定 → 专业模型调用 → 计算筛选 → 外部蛋白制备与检测 → 结果汇总

保留各靶点柱状图中的送检数量,不只展示百分比。不同模型及运行模式使用各自分母。

保留命中率图,使用原技术报告Figure 1的完整口径。

来源:Anthropic蛋白设计技术报告,Figure 1。完整图能同时展示失败靶点和实际分母,优于仅保留总体命中率。

备注

研究实际制备数量与最终分析数量不同:报告记载共制备1,440条设计,其中成熟GDF8相关120条因靶蛋白聚集问题被排除;1,320条是最终分析口径。不得将其分配给每个模型,或直接写成全部实际合成量。(Anthropic)


P22

建议标题

Claude可解析原始仪器数据,现有结果仍限于单一样品案例

建议正文

 在一份常规质控样品的测试中,Claude直接读取NMR与LC-MS原始文件,分别用23分钟和19分钟完成处理并输出结果。LC-MS测得纯度为96.4%,与CRO报告的96.33%接近。(Anthropic)

 该案例表明通用模型可辅助处理实验仪器数据,但不能据此认定样品制备、仪器检测及结果判定均已自动化。跨样品、跨仪器的稳定性仍需更多验证。

表格/图中文字建议

任务模型输出已披露结果
NMR解析处理后谱图及信号峰表23分钟,18个信号
LC-MS分析色谱、质谱及纯度结果19分钟,纯度96.4%
证据范围单一样品质控案例不代表完整实验流程自动化

保留现有NMR输入输出图。

来源:Anthropic实验数据解析技术报告

备注

删除“设计—验证—解析全链均由AI承接”。本例与前页蛋白设计项目不是同一套完整实验流程。建议本页移至附录。


P23

建议标题

Xaira同时布局分子设计与扰动数据,自建实验支撑药物研发

建议正文

 Xaira将蛋白及抗体设计、生物学数据生成与药物研发纳入同一体系。分子设计侧采用RFdiffusion、ProteinMPNN、RFantibody等技术;疾病研究侧通过细胞扰动数据分析靶点及作用机制。(AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx)

 实验不仅用于确认候选是否结合,还用于评价表达、稳定性、非特异性及功能表现。公司以此筛选具有后续开发价值的分子,而非只追求初始结合命中。(Xaira Therapeutics)

表格/图中文字建议

原技术工具表压缩为三类。

模块主要工具或数据研发作用
分子设计RFdiffusion、ProteinMPNN、RFantibody等生成蛋白骨架、序列及抗体候选
疾病生物学X-Atlas、X-Cell分析基因扰动与细胞响应
实验筛选结合、表达、稳定性及功能评价筛选可继续开发的候选

保留表格。 不再增加创始团队或融资信息图。

备注

RFdiffusion、ProteinMPNN等属于公开技术体系,不宜直接列为Xaira独占的模型资产。


P24

建议标题

X-Cell以大规模扰动数据训练,研究对象是细胞响应而非蛋白结合

建议正文

 X-Cell基于X-Atlas/Pisces数据训练,数据集包含约2,560万份扰动单细胞转录组,来自7个CRISPRi Perturb-seq筛选体系。最大版本参数量约49亿,用于预测基因扰动后的细胞状态变化。(Xaira Therapeutics)

 这类数据主要服务于疾病机制研究和靶点判断,与蛋白表达、结合及功能筛选属于不同实验体系。其对药物研发的价值,仍需结合后续候选验证评价。

表格/图中文字建议

图中只保留三个信息层次:

输入:基因扰动与对照细胞状态

训练数据:约2,560万份单细胞转录组

输出:预测扰动后的细胞响应

删除正文及图中重复的细胞数量、细分组合数量和网络维度。

保留现有X-Cell图,但仅保留数据来源与预测任务部分。

来源:X-Cell官方项目页。网络细节与本章实验需求测算关系较弱,可裁去。

备注

2,560万是单细胞转录组数量,不能换算为定制蛋白数量,也不能与binder送检数量直接比较。


P25

建议标题

Xaira将可开发性纳入早期筛选,结合命中只是候选评价的起点

建议正文

 Xaira提出“Progressable Binder”评价框架,在结合能力之外,同时考察表达、热稳定性、单体比例及非特异性。能够结合靶点,并不代表分子已具备后续开发条件。(Xaira Therapeutics)

 公司披露的内部参考要求包括早期亲和力约100 nM或更优、单体比例不低于90%等。通过初筛的候选仍需开展功能及后续药物属性评价,实验内容随研发推进而增加。(Xaira Therapeutics)

表格/图中文字建议

表名改为:Xaira早期候选筛选的部分评价维度

评价维度公司披露的参考要求主要目的
结合能力早期亲和力约100 nM或更优确认靶点结合
表达高通量哺乳动物表达体系评价判断制备可行性
热稳定性按Fab、VHH等分子类型设置要求筛除稳定性不足的候选
单体比例SEC单体比例不低于90%识别聚集风险
非特异性及功能按项目开展相关实验判断结合质量及生物学作用

替换原通用研发循环表述,使用候选推进图。

来源:Xaira:Progressable BindersFigure 2,De novo design hit-to-lead progression。该图直接说明结合命中之后仍需哪些筛选,比重复介绍RF工具更贴近后半章主线。

备注

上述阈值为Xaira披露的内部评价框架,不是通用行业标准。


P26

建议标题

Chai-1侧重结构预测,Chai-2/3拓展分子设计与药企合作

建议正文

 Chai-1用于多分子复合物结构预测,Chai-2则根据靶点和表位直接设计抗体、纳米抗体及miniprotein。两代模型解决的问题不同,不能仅用同一项结构预测指标评价。(Chai Assets)

 2026年披露的Chai-3开始通过药企合作进入研发流程。公司称其抗体设计成功率较Chai-2提高,但完整实验分母和统一比较数据尚未随相关公告披露。(Business Wire)

表格/图中文字建议

模型首次公开主要任务已公开的验证内容
Chai-12024年9月多分子复合物结构预测结构预测计算基准
Chai-22025年6月表位导向的de novo分子设计多靶点结合、结构及部分功能实验
Chai-32026年6月面向药企研发的下一代设计模型公司称成功率约为Chai-2的2倍;完整可比数据未披露

保留代际对比表。 删除长篇创始人履历和融资估值,不另加公司宣传图。

备注

“成功率约2倍”属于公司披露,不能直接将Chai-2的16%乘以2,写成Chai-3的统一命中率。


P27

建议标题

Chai-2已完成多靶点湿实验,不同研究批次需分别统计

建议正文

 Chai-2根据靶点及表位生成候选,再通过表达、结合及结构实验验证。首轮抗体及纳米抗体研究覆盖52个靶点,每靶点最多送检20条设计,约一半靶点获得至少一个命中。(Chai Discovery)

 后续全长IgG和GPCR研究扩大了评价范围,但采用了不同的样本和送检规模。可开发性及功能结果应与首轮命中率分开呈现,不能统一套用“每靶点不超过20条”。(Chai Discovery)

表格/图中文字建议

研究批次样本或送检口径主要结果
首轮抗体及纳米抗体研究52个靶点;每靶点最多20条候选级命中率约16%;约半数靶点获得命中
miniprotein研究与抗体研究分开统计候选级命中率约68%
后续全长IgG评价88个设计,覆盖28个抗原86%的设计仅出现0–1项可开发性风险提示
后续GPCR研究6个靶点;每靶点10–73条6个靶点均获得binder

保留现有design→wet lab流程图。

来源:Chai-2发布说明。图下注明“首轮研究流程”;后续IgG及GPCR结果放入独立表格,不混在同一实验分母下。

备注

“52个此前没有已知抗体的靶点”建议改为“52个在SAbDab中缺乏相应已知抗体结合信息的靶点”。数据库缺少记录,不等于文献及产业界不存在相关抗体。


P28

建议标题

ESM体系覆盖表征、生成与结构预测,各工具承担不同任务

建议正文

 ESM3联合处理蛋白序列、结构和功能信息,用于条件生成;ESM C侧重序列表征,ESMFold2用于结构及复合物预测。三者并非简单的前后替代关系。(EvolutionaryScale)

 Biohub继续扩展相关模型及ESM Atlas数据资源,为候选生成、结构评估和蛋白检索提供工具。对湿实验的影响,应结合实际设计与验证流程判断,而非按模型名称排列代际。(Biohub)

表格/图中文字建议

工具主要任务典型输出
ESM3序列、结构和功能条件生成满足给定约束的蛋白设计
ESM C蛋白序列表征用于下游预测及分析的模型表征
ESMFold2蛋白及复合物结构预测三维结构及相关置信度
ESM Atlas蛋白数据组织与检索序列、预测结构及关联信息

保留对比表。 不画“ESM3→ESM C→ESMFold2”的单向升级箭头。

备注

ESM Atlas收录的数据规模,不应直接作为某一模型的训练数据量。


P29

建议标题

ESM3通过两轮实验获得esmGFP,计算设计仍需功能结果筛选

建议正文

 esmGFP研究使用ESM3的7B版本,根据GFP部分结构约束生成并筛选候选。团队先后开展两轮96孔板实验,并利用首轮结果选择后续设计起点,最终获得具有荧光功能的esmGFP。(U-M Personal Web Server)

 esmGFP与最接近的已知荧光蛋白序列一致性约58%;在论文设定的检测条件下,其亮度处于所测天然荧光蛋白的范围内。该结果同时依赖计算筛选与真实功能测定。(U-M Personal Web Server)

表格/图中文字建议

图名改为:esmGFP设计与两轮功能验证

流程文字:

结构约束 → 计算生成与筛选 → 首轮96孔板实验 → 选择后续设计起点 → 第二轮96孔板实验 → esmGFP

图下注:

96孔板包含对照,不等于每轮合成96条新设计。两轮实验也不等于两轮模型重新训练。

替换现有大幅模型架构图,使用实验结果图。

来源:Science原始论文Figure 4B–C,优先保留两轮孔板及荧光亮度比较。它比架构图更直接回答“生成以后实际做了多少实验”。

备注

正式论文首轮为88个设计,96孔板还包含对照。删除“两轮各96个候选”及“192条新设计”的写法;“58%”对应最接近的已知蛋白,不应改写为最接近的天然蛋白。(U-M Personal Web Server)


P30

建议标题

ESMFold2支持五靶点binder设计,部分候选已开展细胞功能验证

建议正文

 Biohub利用ESMFold2支持的设计流程,在EGFR、PDGFRβ、PD-L1、CTLA-4及CD45五个靶点获得实验确认的binder。公告披露,minibinder候选级命中率为36%–88%,抗体衍生scFv为15%–29%。(Biohub)

 部分PD-L1候选还开展了T细胞信号相关功能实验。结合命中和功能结果应分层展示,不能仅以最佳亲和力代表全部候选质量。(Biohub)

表格/图中文字建议

保留两个信息框:

结合验证:五个靶点均获得binder

功能验证:部分PD-L1候选开展T细胞信号相关实验

删除正文、图旁及下方对同一命中率的三次重复。代表性Kd保留在原图中,不再另列五个大号数值。

保留现有命中率及结合实验图。

来源:Biohub官方研究说明

备注

所引公司公告未列完整的逐靶点送检分母。补齐原始实验表之前,不将这些百分比用于跨平台排名;也不再写“验证仅限结合”。


P31

建议标题

AlphaFold扩展复合物预测范围,Isomorphic将相关能力用于药物设计

建议正文

 AlphaFold 2主要预测蛋白结构,AlphaFold 3将范围扩展至蛋白与配体、核酸等多分子复合物。预测对象增加,不等于模型已直接完成新蛋白序列的de novo设计。(Nature)

 Isomorphic Labs在此基础上开发IsoDDE,将结构、结合口袋及亲和力评估用于候选筛选和优化。相关计算结果能够辅助实验决策,但不能替代真实结合及药效验证。(Google Cloud Storage)

表格/图中文字建议

改为三阶段对照:

技术主要任务与实验的关系
AlphaFold 2蛋白结构预测提供结构假设
AlphaFold 3多分子复合物结构预测支持相互作用与结合构象分析
IsoDDE结构、口袋及亲和力评估辅助候选筛选与优化

替换:自行重绘上述三阶段示意图。

依据:AlphaFold 3原始论文IsoDDE技术报告。现有AF3网络结构图过于技术化,不能直接说明其与湿实验的关系。

备注

删除未经项目明细支持的统一IND时间表及估值判断。


P32

建议标题

IsoDDE整合结构、口袋与亲和力预测,公开结果主要来自计算基准

建议正文

 IsoDDE将复合物结构预测、潜在结合口袋识别及亲和力评估纳入同一设计流程,用于候选排序和分子优化。其作用是帮助决定哪些候选值得进入后续合成与实验。(Google Cloud Storage)

 当前技术报告主要展示结构泛化、口袋识别及亲和力预测等基准结果。这些指标与真实项目的合成成功率、结合命中率及药效成功率不同,不宜互相替代。

表格/图中文字建议

三幅子图标题统一为:

结构预测:未见体系的泛化表现

口袋识别:潜在结合位点识别能力

亲和力预测:预测值与实验值的一致性

删除“计算表现提升直接减少多少湿实验”等未经项目数据支持的结论。

保留原技术报告Figure 1,删除第二张Cereblon案例图。

来源:IsoDDE技术报告Figure 1。一页保留一组总览指标,比叠加多个案例更清楚。

备注

本页没有可用于实验需求测算的完整送检分母,不据此估算节省的合成数量。


P33

建议标题

binder命中率受送检分母与实验条件影响,跨项目比较需统一口径

建议正文

 候选级命中率以进入指定实验的设计为分母,靶点级命中率则统计是否至少获得一个binder。计算生成量不能替代湿实验分母,未表达和质控失败如何计入,也需说明。

 每靶点送检量、靶点构象、检测方法及命中阈值均会影响结果。比较时应同时保留失败靶点和验证方,不能仅按一个百分比排序。AlphaProteo的TNFα实验为0/54,不能从总体评价中略去。(arXiv)

表格/图中文字建议

表名改为:代表性binder项目的实验分母与验证口径

项目或实验组候选级命中率送检口径靶点数验证与统计方式
Anthropic多靶点:Mythos Preview26.7%,104/390每靶点30条13两家外部CRO实验,研究团队按规则汇总
Anthropic多靶点:Opus 4.822.6%,88/390每靶点30条13同上
Anthropic单靶点:Mythos Preview35.1%,158/450每靶点30条15单靶点集中计算资源的实验组
Chai-2首轮抗体及纳米抗体约16%每靶点最多20条52公司团队研究,体外结合评价
AlphaProteo0%–88%Table 1为每靶点54–172条8研究团队实验;包含TNFα失败结果
ESMFold2 minibinder36%–88%所引公告未列完整逐靶点分母5Biohub披露,体外结合实验

Anthropic三行是选列实验组,不构成整个项目的完整汇总。(Anthropic)

保留对照表,不新增柱状排名图。 不同实验口径不适合排列成统一“模型成功率榜单”。

备注

删除原页“每个模型均约88条/靶点”的写法;1,320÷15只是项目汇总平均值。删除“命中率提升并不减少湿实验总量”,需求讨论移至P43。


P34

建议标题

训练投入披露程度不一,ESM3已公开参数、数据及计算量

建议正文

 ESM3披露了参数规模、训练步数和FLOPs;Chai-1与AlphaFold 3披露了GPU及训练时长。Chai-2/3的训练细节仍较有限,现有资料不足以建立统一的“训练投入—设计成功率”关系。(Rivista AI)

 训练步数是模型参数更新的次数,不是计算设计轮次或湿实验轮次。下表只列训练信息,不混入候选生成量、孔板数量和实验命中率。

表格/图中文字建议

删除“验证结果”列,将模型压缩至本章三条主线。

模型参数规模训练计算与时长Training steps训练数据来源与规模
ESM31.4B/7B/98B版本最大版本约1.07×10²⁴ FLOPs最大版本约43万步UniRef、MGnify、JGI等;约27.8亿条序列、7,710亿语料token,并加入结构及功能信息
Chai-1模型总参数未披露128块A100,约30天未披露PDB及AlphaFold DB;完整去重训练量未披露
Chai-2未披露未披露未披露未披露
Chai-3未披露未披露未披露未披露
AlphaFold 3未披露256块A100;四阶段约10/3/5/2天;FLOPs未披露未直接列示PDB实验结构及蒸馏数据;完整去重训练量未披露

表下注:按所引原始论文及官方资料列示,不根据模型表现反推参数或训练规模。(Rivista AI)

保留训练信息表,不叠加架构图。

原始核对资料:ESM3论文及补充材料Table S1Chai-1技术报告AlphaFold 3论文的补充材料Table 6

备注

Chai-1使用的30亿参数蛋白语言模型是嵌入模块,不是Chai-1总参数量。ESM3约7,710亿语料token与训练累计处理约1.8万亿token不是同一口径。原稿AF3“训练计算未披露”应更正。


P35

建议标题

ESM与Chai扩展生成设计,AlphaFold主要拓展复合物预测范围

建议正文

 三条技术路线的代际变化并不相同:ESM增加结构和功能条件生成,Chai从结构预测扩展至分子设计,AlphaFold则扩大可预测的分子类型。不能将三者概括为同一条“参数增加、命中率上升”的路径。(EvolutionaryScale)

 验证方式也应随任务区分。生成模型需要证明新设计能够表达并具有预期功能;结构预测模型主要评价预测准确性。是否增加湿实验,应结合设计任务及候选推进情况判断。

表格/图中文字建议

表名改为:三条模型路线的训练、任务与验证变化

模型路线训练侧变化设计或预测任务变化验证侧变化
ESM2→ESM3最大版本约15B→98B;增加结构和功能信息序列表征扩展至多信息条件生成ESM3开展荧光蛋白制备及功能测定
Chai-1→Chai-2→Chai-3缺少统一披露的代际训练数据复合物预测→表位导向设计→药企研发应用扩展Chai-1以计算基准为主;Chai-2已有多靶点实验;Chai-3完整可比结果未披露
AF2→AF3扩展分子类型及相应训练数据蛋白结构预测→多分子复合物预测主要比较结构预测基准,不等于新序列的湿实验验证

ESM2最大参数规模依据官方模型清单;其余信息分别对应相关论文及公司公告。(GitHub)

替换为自行重绘的三行对照图。 每行固定“训练侧—任务侧—验证侧”,不再叠加ESMFold2的详细命中率。

备注

删除“ESM2约5,000万条→ESM3约27.8亿条”的直接倍数比较;聚类代表序列与完整语料的统计方式不同。也不再将ESM C、ESMFold2画成ESM3的直接下一代。


P36

建议标题

计算候选进入实验后,外部平台承接DNA、蛋白制备与检测

建议正文

 Anthropic案例将计算设计与实验执行分开:模型负责提出和筛选候选,外部平台负责实体制备、表达及结合检测。候选能否表达、是否结合,仍需由实验给出答案。(anthropic.com)

 Adaptyv侧重标准化的序列到数据服务,Twist覆盖DNA合成及蛋白实验,金斯瑞则提供基因至蛋白及抗体服务。三类平台的承接环节存在重叠,但服务组织方式不同。(Adaptyv Bio)

表格/图中文字建议

表名改为:AI蛋白设计后的主要实验承接方式

平台主要承接环节交付内容与Anthropic案例的关系
Adaptyv BioDNA供应衔接、无细胞表达、结合检测表达状态及结构化结合数据官方报告列示的实验平台
TwistDNA合成、哺乳动物表达及蛋白表征蛋白样品、结合、表达及纯度数据官方报告列示的实验平台
GenScript基因合成、蛋白及抗体表达、纯化与分析基因至蛋白的定制交付未列为该项目的直接实验平台

替换为两家实验平台的原始流程图。

来源:Anthropic技术报告Figure M3A,PDF第8页。该图可直接说明Adaptyv与Twist采用不同表达及检测方案,比市值、收入横向表更适合作为产业链过渡页。

备注

不再放市值及年度收入。Adaptyv衔接DNA供应,不等于其自行完成全部DNA制造。


P37

建议标题

Twist在三周内完成1,260条设计评估,服务已覆盖蛋白制备与表征

建议正文

 在Anthropic项目中,Twist采用HEK293体系表达Fc融合蛋白,并在不到三周内完成1,260条设计的生产及独立评估。交付内容已超出DNA合成,覆盖蛋白制备和实验表征。(Twist Bioscience)

 实验包括高通量SPR、表达滴度及分析型SEC,可同时提供结合、表达和样品质量信息。客户获得的不只是实体分子,还包括用于后续筛选的数据。(Twist Bioscience)

表格/图中文字建议

环节Twist在项目中的工作主要输出
蛋白制备HEK293表达Fc融合蛋白可供检测的蛋白样品
结合表征高通量SPR结合实验数据
表达评价滴度测定表达水平
样品质量分析型SEC单体及聚集相关信息

将原大号文字改为:

1,260条设计:蛋白生产与独立评估

交付周期:不到三周

保留项目表,删除重复的总体命中率图。

来源:Twist官方项目说明

备注

1,260条是Twist评估口径,不与Adaptyv数量相加。删除“DNA合成与蛋白解决方案分别占49%和51%”:原业务分类中二者属于同一组合,另一类是NGS。


P38

建议标题

Adaptyv以自动化实验承接设计序列,交付表达与结合数据

建议正文

 Adaptyv面向客户提供从序列提交、DNA供应衔接、无细胞表达,到结合检测及数据交付的标准化服务。模型团队无需自建完整实验流程,也可获得候选的真实实验结果。(Adaptyv Bio)

 Anthropic项目中,Adaptyv对1,320条设计返回1,296条状态记录,包括336条结合、899条未结合及61条未表达;另有24条未返回结果。不同失败类型可为后续筛选提供不同信息。(Anthropic)

 当前常规服务覆盖24–768条批次,标准方案包含2个重复,产品页列示周期为3–4周。更大项目需单独确认实验方案、报价与排期。(Adaptyv Bio)

表格/图中文字建议

表名改为:Adaptyv从序列到实验数据的交付内容

服务步骤主要交付内容
序列接收与DNA准备可进入表达流程的构建材料
无细胞表达表达样品及表达状态
结合筛选结合判定及相关实验曲线
数据质控与交付序列关联的结果、异常标记及结构化数据

删除融资金额及大号报价,本页集中讲能力;价格统一放P43。

替换为自行重绘的流程图:

序列 → DNA准备 → 无细胞表达 → SPR/BLI → 质控与结构化数据

依据:Adaptyv官方项目复盘。比泛化的自动化平台介绍图更容易看清实际交付内容。

备注

1,296条是有状态记录的设计,不是1,296条均完成有效结合测定。基础结合筛选与完整亲和力动力学测定应分开表述。


P39

建议标题

Twist依托硅芯片开展并行DNA合成,基因交付已达年百万条附近

建议正文

 Twist通过硅芯片实现高密度并行DNA合成。公司披露,平台在满规模条件下单芯片可合成超过100万条寡核苷酸,约对应9,600条基因组装,为多序列并行构建提供制造能力。(Twist Bioscience)

 FY2025公司交付约93.8万条基因,同比增长22%。该指标反映实际基因交付规模,但不能直接代表蛋白表达数量或下游检测产能。(Twist Bioscience)

表格/图中文字建议

指标公司披露值口径
单芯片寡核苷酸规模超100万条平台技术能力
单芯片基因组装规模约9,600条满规模条件下的平台口径
FY2025基因交付约93.8万条实际年度交付量
基因交付同比增长22%FY2025较FY2024

替换为Twist官方硅芯片并行合成示意图,将P40的工艺图移至本页。

来源:Twist Technology,网页中的传统合成与硅芯片合成对比图,无统一Figure编号。该图直接支持本页的并行制造能力判断。

备注

不将“寡核苷酸条数”“组装基因条数”和“表达蛋白数量”混用。公开技术能力也不等于实际产能利用率。


P40

建议标题

Twist季度收入增长23%,DNA合成及蛋白相关业务增速较快

建议正文

 FY2026第三季度,Twist收入1.184亿美元,同比增长23%。其中,DNA合成及蛋白解决方案收入同比增长39%,高于NGS应用的12%。(Securities and Exchange Commission)

 公司将全年收入指引上调至4.56–4.57亿美元。上述增长体现整体业务表现,现有披露尚不足以单独测算AI蛋白设计的收入贡献。(Securities and Exchange Commission)

表格/图中文字建议

表名改为:Twist FY2026第三季度收入及全年指引

项目收入同比
DNA合成及蛋白解决方案5,660万美元+39%
NGS应用6,180万美元+12%
公司合计1.184亿美元+23%
FY2026全年收入指引4.56–4.57亿美元指引,非实际完成值

替换:按最新业绩公告自行重绘两类业务收入及增速。

来源:Twist FY2026第三季度业绩公告。本页不再放芯片工艺图。

备注

删除“资本开支显著收缩”:原稿将全年与单季度数据比较,不能支持该结论。其他页面如保留FY2025收入,应使用约3.766亿美元,而非3.776亿美元。(Twist Bioscience)


P41

建议标题

金斯瑞Gene-to-Protein占生命科学收入66%,AI相关业务保持增长

建议正文

 金斯瑞生命科学业务覆盖基因合成、蛋白及抗体表达、纯化与分析。TurboCHO公开标示日通量超过1,000个抗体,具备承接多候选并行制备的服务基础。(GenScript)

 2026年上半年,Gene-to-Protein约占生命科学业务收入的66%,AI药物发现相关收入同比翻倍;后者绝对规模尚未单独披露。(GenScript)

 ESM3补充材料披露,GenScript曾承担esmGFP及对照的独立复现实验,已有蛋白生成项目的实验服务记录。该案例比单纯比较市值,更能说明其与AI蛋白设计的业务联系。(Rivista AI)

表格/图中文字建议

表名改为:Twist与金斯瑞生命科学业务的服务侧重

比较维度Twist金斯瑞生命科学业务
DNA环节硅芯片高密度并行合成基因合成及相关构建服务
蛋白环节蛋白制备、抗体发现及表征服务多表达体系、蛋白及抗体制备
检测环节结合、表达及样品质量评价纯化、质量分析及可选表征服务
本章观察重点DNA订单与蛋白服务延伸Gene-to-Protein及AI相关客户需求

保留能力对照表,删除市值及未经统一口径核验的市场份额。

需要补充小图时,可使用TurboCHO官方平台资料中的基因至表达、纯化流程图,不再增加集团业务全景图。

备注

“超过1,000个抗体/日”为平台能力,不是实际日订单或利用率。GenScript参与的是esmGFP相关独立复现实验,不应写成承接ESM3全部两轮实验。


P42

建议标题

公开数据库提供通用信息,具体候选的实验表现仍需逐一确认

建议正文

 PDB、UniRef、MGnify、AFDB及OAS提供结构、序列或抗体信息,可用于模型训练与方法开发。其中,预测结构与实验结构属于不同证据类型,不能互相替代。(AI制药_P19-45_海外企业专章_湿实验闭环扩展版_20260906.pptx)

 具体候选能否表达、是否结合、是否具有功能及可开发性,仍需在明确条件下验证。未表达、未结合与检测失败应分别记录,避免将技术失败误作生物学阴性。(Anthropic)

 实验增量应同时包含序列、结果、实验条件及质量标记。经授权后,这些数据可用于候选筛选、下一轮设计及模型迭代。

表格/图中文字建议

数据类别代表内容能够提供什么不能直接回答什么
公共序列UniRef、MGnify、OAS等已观测序列及相关统计信息新候选在指定条件下是否有效
公共结构PDB实验结构、AFDB预测结构结构与相互作用分析依据新设计是否表达、是否具有功能
项目实验标签表达、结合、活性、特异性、可开发性候选在具体条件下的真实表现不经验证即跨条件外推的结果
实验元数据条件、对照、重复、质控及失败原因判断结果是否可用、可比较缺失元数据时的可靠泛化

替换ESM3规模曲线,自行重绘“公共数据—项目实验数据”双栏图。

右栏突出:

表达成功/失败|结合/未结合|活性|特异性|可开发性|质控失败原因

备注

实验服务商不当然拥有客户数据,也不当然有权跨客户用于训练。数据价值需与授权范围、质量及可复用性一并判断。


P43

建议标题

送检规模决定实验支出,万条候选对应约百万美元级基础结合筛选

建议正文

 百万级计算候选不等于百万级真实合成。ProGen曾生成约100万条序列,选择100条开展表达验证;公开项目也已出现跨靶点千条级送检,计算量与实验量仍相差较大。(Nature)

 需求测算应从“项目数×靶点数×每靶每轮送检量×实验轮次”出发。命中率改善可能减少单项目所需候选,项目扩张及更多靶点尝试则可能增加总实验量。

 按当前公开起价,1 kb DNA片段约70美元/条,基础sequence-to-binding服务为99美元/条起。以下按两种独立服务情景测算,不将其相加作为单条总成本。(Twist Bioscience)

表格/图中文字建议

表名改为:不同送检规模对应的实验支出量级参考

单位:万美元

送检规模DNA-only参考:1 kb片段,70美元/条基础sequence-to-binding参考:99美元/条起
1,000条79.9起
10,000条7099起
100,000条700990起

表下注释直接使用:

DNA情景假设每条1,000 bp,按0.07美元/bp计;sequence-to-binding情景按基础结合筛选公开起价计。按公开目录价线性外推,仅用于量级参考,不代表实际项目报价。未考虑规模折扣、税费及额外实验,两类服务范围存在重叠,不可相加。

表上方可增加一行:

实验需求量 ≈ 项目数 × 靶点数 × 每靶每轮送检量 × 实验轮次

保留情景测算表,自行重绘,不使用公司宣传图。

价格依据:Twist基因产品目录Adaptyv结合筛选服务页

备注

原稿Adaptyv“149美元起”应更新为当前页面的“99美元起”。该起价对应基础结合筛选,不等于包含完整动力学、功能及可开发性评价。10万条仅为测算情景,不代表平台已公开的单批产能或交付承诺。


P44

建议标题

DNA只是候选构建起点,服务范围随表达和功能验证延伸

建议正文

 DNA交付后,候选仍需经过表达、纯化及质量控制,才能获得适合检测的蛋白样品。低表达、不可溶或聚集等问题,不能仅凭序列设计排除。(GenScript)

 通过初筛的候选还需评价结合、功能及可开发性。随着候选逐层减少,单个入选分子的评价深度增加;服务内容也从DNA构建延伸至样品制备与多维表征。

表格/图中文字建议

删除公司报价,改为服务环节与交付物。

环节主要交付物解决的问题
DNA合成基因片段或构建载体能否将设计序列实体化
蛋白表达表达样品及产量记录能否获得目标蛋白
纯化与QC纯化样品、纯度及单体信息样品是否适合检测
结合表征SPR/BLI等结合数据是否结合、结合表现如何
功能验证生化或细胞功能结果是否产生预期生物学作用
可开发性评价稳定性、聚集及非特异性等结果是否适合继续开发

替换为自行重绘的“候选筛选漏斗+服务环节”图。

上方标注:候选数量逐层减少

下方标注:单个入选候选的评价内容增加

依据:Xaira候选评价框架GenScript平台资料

备注

不是所有候选都会经过全部六个环节。本页说明服务范围扩展,不据此判断各环节毛利率或单价高低。


P45

建议标题

定制蛋白服务涉及多环节协同,规模交付依赖流程稳定性

建议正文

 定制蛋白服务的进入要求不只在DNA合成。序列复杂度、表达体系、纯化方法及表征方案都会影响交付,需要相应的工艺积累和质量控制。(Twist Bioscience)

 高通量项目还要求样品追踪、自动化排程、标准化实验和异常处理相互匹配。批次一致性、结果可追溯及交付周期,是评价平台规模化能力的重要维度。(Adaptyv Bio)

 我们认为,稳定交付及与客户研发流程的衔接,有望增强平台客户粘性;仅凭设备数量或单次项目规模,尚不足以判断长期竞争优势。

表格/图中文字建议

表名改为:定制蛋白服务的主要能力要求及观察指标

环节需要具备的能力建议观察指标
DNA合成与构建并行合成、组装、错误校正及复杂序列处理准确率、构建完成率、复杂片段交付
蛋白表达与纯化表达体系选择、工艺适配及纯化流程表达成功率、产量及批次一致性
质量与实验表征QC、SPR/BLI及功能实验的开发和执行样品质量、对照表现、曲线质量及重测率
自动化与流程管理样品追踪、排程、标准作业及异常处理周期、交付一致性及可追溯性
数据交付与使用序列关联、结构化结果、元数据及授权管理数据完整性、可复用性及授权范围

保留能力矩阵,自行重绘。 删除各环节的重复报价、年度交付量和“后进入者追赶周期”。

备注

表列指标为建议评估维度,不是各平台已披露的经营数据。删除“切换成本极高”“后进入者追赶以年计”等缺少证据的判断。


建议合并/删除的页面

P22:移至附录

原因: 单一样品的NMR/LC-MS解析能说明数据处理能力,但与蛋白候选的合成、表达及结合需求联系较弱,也容易被误读为完整湿实验自动化。

建议: 正文保留P21蛋白设计案例;P22作为“科研数据分析应用”补充材料。

P23 + P24

原因: X-Cell详细架构与定制蛋白需求不是同一问题。纪要更关注模型发展带来的下游需求,以及实验平台的能力和进入要求。(王云鹏语音任务纪要_20260901.md)

建议: P23保留“分子设计—扰动数据—实验筛选”三模块;将P24压缩为其中一个数据框。P25保留,用于说明binder之后仍需哪些评价。

P31 + P32

原因: 两页均围绕结构、口袋和亲和力预测展开,单独展开容易使读者误以为这些基准可直接用于计算湿实验命中率。

建议: 合为一页,上半页说明AF2→AF3→IsoDDE的任务变化,下半页保留IsoDDE Figure 1,并明确“公开结果主要为计算基准”。


P19–P45最终故事线

P19先区分海外平台的技术定位与验证内容,P20–P22再以Anthropic说明通用模型如何连接专业设计工具、外部实验和数据分析。

P23–P25介绍Xaira的模型、数据及药物研发体系,落点不是工具数量,而是结合命中之后仍需开展的表达、功能与可开发性评价。

P26–P27用Chai展示从结构预测到分子设计的任务变化,并把首轮命中率与后续IgG、GPCR实验分开统计。

P28–P30用ESM展示表征、生成和结构预测的分工,再以esmGFP和binder实验说明计算设计如何接受真实功能检验。

P31–P32补充AlphaFold与IsoDDE路线,明确结构和亲和力预测可以辅助筛选,但不能与真实送检命中率混为一谈。

P33先解决实验分母与可比性问题,P34再单独列训练投入,P35据此总结模型代际变化,避免把训练、计算设计和湿实验混在一起。

P36将讨论转向实验承接方,P37–P38分别说明Twist和Adaptyv实际完成了哪些制备、检测与数据交付工作。

P39–P40补充Twist的并行制造和经营规模,P41再以服务能力、已披露AI相关业务及实验案例连接金斯瑞。

P42解释公共数据库之外仍需新增哪些实验标签,P43据此用送检规模和独立价格情景估算需求量级,而不是把计算候选数直接当作订单量。

P44说明服务内容如何从DNA延伸至蛋白和功能评价,P45最终落到工艺、自动化、质控、数据交付和流程稳定性等多环节进入要求。

이 Q&A 공유하기