
做蛋白表达这些年最让我头疼的不是膜蛋白也不是大分子复合物而是看起来体积不大、结构听起来也不复杂的转录因子。三年前我接了一个带长段无序激活域的人源转录因子在大肠杆菌里全是包涵体换成哺乳细胞之后表达量低到没法看降解还严重折腾了两个月都没交出能用的样品。后来在同行实验室接触到无细胞表达筛选的路子尤其是Nuclera eProtein Discovery无细胞蛋白表达筛选系统这类自动化平台之后我才明白问题不在“表达体系不够好”而在我一直用“养细胞”的思维去解决一个“条件筛选”的问题。这篇文章就把难表达转录因子为什么难、无细胞表达筛选到底怎么破局、这类系统的核心原理以及实际操作流程拆开讲一遍。你手里如果有类似的难表达蛋白完全可以照着这个思路走一轮大概率能省下几周甚至几个月的试错时间。1. 难表达转录因子蛋白到底难在哪很多人一听到转录因子第一反应是“这蛋白不大应该不难表达”结果一上手就卡住。其实转录因子的表达难度是由它自身的结构特征决定的不是靠换一套细胞系就能绕过去的。搞清楚这一点后面选策略才有依据。1.1 转录因子的结构特征决定它天生不好对付经典的转录因子一般由DNA结合域DBD和转录调控域组成DBD常见的是锌指、螺旋-环-螺旋、亮氨酸拉链、同源异型域这几种模式调控域则往往是转录激活域或抑制域。问题就出在调控域上这类区域普遍富含酸性氨基酸、脯氨酸或丝氨酸残基整体缺乏稳定的疏水核心属于典型的固有无序区域也就是我们常说的IDR。IDR在游离状态下没有固定三维结构整个分子像一根没有支撑的软绳疏水残基暴露在外很容易在翻译过程中和相邻的新生肽链发生非特异聚集。在活细胞里真核转录因子的无序区通常需要伴侣蛋白或翻译后修饰来维持可溶状态一旦我们在原核或真核体系里强制高表达细胞内的伴侣池被冲垮蛋白很快就会以包涵体或可溶性聚集体的形式“报废”。我印象最深的是一个含Cys2His2锌指的转录因子DNA结合域本身非常稳定可一挂上旁边的转录激活域整个重组蛋白在表达时就开始沉淀。后来把激活域截掉只表达DBD产量和可溶性立刻改善。这说明“难表达”往往不是全蛋白的问题而是某个结构域在宿主环境中缺乏所长。另外锌指结构域依赖锌离子培养基或裂解液里锌不足时新合成的肽链不能正确配位金属离子会形成错误折叠并被蛋白酶降解还有一些转录因子以同源二聚体或异源二聚体形式发挥功能二聚化界面上的疏水残基在单体状态下就处于不稳定状态。这些特征叠加起来让转录因子成为典型的“条件敏感型”蛋白。1.2 活细胞表达体系把问题放得更大了如果我们用大肠杆菌表达真核转录因子首先会遇到密码子偏好和稀有密码子的问题其次是N端甲硫氨酸切除效率低更麻烦的是缺少真核伴侣蛋白、缺少锌指配位所必需的细胞内环境加上很多转录因子对宿主有毒性。T7启动子系统的背景表达一旦漏出来目标蛋白还没诱导就已经在损伤大肠杆菌细胞为了自保会启动蛋白酶系统把外源蛋白降解掉。就算最后获得了包涵体复性过程面对一个含IDR的蛋白基本等于碰运气。换到哺乳动物细胞表达问题也没消失。转录因子通常带有核定位信号NLS表达后会被主动转运进细胞核纯化时你先要裂解细胞、破碎核膜过程中的释放和聚集问题得额外处理。更关键的是过表达的转录因子会强行进入细胞的转录调控网络激活或抑制下游基因造成细胞应激甚至凋亡。细胞不会傻乎乎地看着你生产一个干扰自己生存的蛋白它有一整套降解机制等着你。昆虫杆状病毒系统虽然表达水平高能做一些翻译后修饰但周期长、通量低每个截短突变体都要走一遍重组病毒构建流程等一轮结果往往要三到四周。这个节奏对于需要同时比较多个结构域、多个突变体、多个物种同源基因的转录因子研究来说实在跑不动。1.3 障碍拆解之后答案是“条件筛选”而不是“换细胞系”把转录因子的表达困难拆解开大概可以分成三个层面一是序列本身能不能被转录翻译机器处理二是表达产物会不会被宿主降解或产生毒性抑制三是蛋白折叠和辅因子结合能不能稳定进行。在活细胞体系里这三个因素是缠绕在一起的不表达你不知道是毒性还是降解表达成包涵体你不知道是折叠问题还是复性方法不对几乎没有办法单独调其中一个变量。但在开放的无细胞表达体系里情况就完全不同了。翻译反应本身不依赖细胞存活你可以在同一批反应里给蛋白加锌离子、加伴侣蛋白、调氧化还原电位、改温度和反应时间甚至换用不同来源的提取物。转录因子高表达引起的毒性在无细胞环境里不复存在降解问题可以通过添加蛋白酶抑制剂来控制折叠问题则可以通过掺入分子伴侣和辅因子来逐项排查。所以对难表达转录因子来说最需要的是一个能快速、并行地扫描大量表达条件的平台而不是继续在几十种细胞系之间来回切换。自动化的无细胞蛋白表达筛选系统解决的就是这个“快速扫描”的问题。2. 破局关键为什么无细胞表达能解转录因子的题聊无细胞表达之前先说明一下它的定位。它不是来取代细胞发酵的也不是包治百病的“银弹”但它在难表达蛋白的初筛和条件优化上确实有活细胞体系给不了的优势。理解它的原理和边界才知道什么时候可以放心使用。2.1 无细胞蛋白表达系统的工作原理无细胞蛋白表达本质上就是把“转录翻译机器”从细胞里搬出来在一个开放的反应管或芯片液滴里运行。常用的反应体系包括大肠杆菌抽提物、麦胚提取物、兔网织红细胞裂解液、CHO细胞提取物等在这基础上补足氨基酸、核苷三磷酸、能量再生系统比如磷酸肌酸/肌酸激酶或PEP/丙酮酸激酶体系、镁离子、辅因子和T7 RNA聚合酶等。你将带有启动子的DNA模板质粒或者线性PCR产物加入反应液体系就会在恒温条件下同时进行转录和翻译通常在两到六个小时内得到目标蛋白。这里有一个关键的技术点无细胞反应不需要维持细胞壁、膜电位或者细胞周期所以你可以把反应条件设计成“对蛋白友好”的样子而不是“对细胞友好”的样子。比如锌指转录因子需要锌离子我直接在反应液里加上如果蛋白需要形成二硫键我加入氧化型谷胱甘肽创造氧化环境如果蛋白容易降解我加EDTA来抑制金属蛋白酶。这些操作在活细胞里几乎不可能精准控制但在无细胞体系里就是移液枪和缓冲液配方的事。另一个实际好处是模板的形式更灵活像转录因子这种经常需要做截短突变体的蛋白线性PCR产物可以直接作为表达模板省掉了“克隆-转化-提质粒”的整个环节。2.2 无细胞表达和活细胞表达的核心差异为了看得更清楚我把两种路径在几个关键维度上对了一下直接列成表格对比维度活细胞表达无细胞表达实验周期转染/转化、筛选、扩培按天到周计算加样、反应按小时计算表达通量受培养设备、摇床和孔板数限制难以做大矩阵可并行几十到几百个独立反应条件毒蛋白耐受毒性蛋白会抑制宿主生长甚至致死无宿主生命活动毒性蛋白可以正常合成条件开放性培养基、诱导剂种类有限胞内环境难以干预缓冲液、辅因子、伴侣蛋白、温度均可自由调整产物获取需要裂解细胞、破碎菌体可能损失目标蛋白产物直接暴露在反应液中便于检测和亲和纯化成本构成培养耗材、时间成本高条件一多难以承受单次反应成本略高但微体积反应把单条件成本压低了从表格能看到活细胞表达的核心优势是低成本放大和天然翻译后修饰环境但在“快速找条件”这个环节上它远不如无细胞体系灵活。转录因子研究里我们往往不是只需要一个产量高的样品而是需要在多个截短体、多个突变体之间找到哪个版本可溶、哪个版本有活性、哪个版本能结合DNA。这种“高维搜索”如果用细胞培养来做条件之间互相干扰数据还不一定可比换成无细胞体系的并行反应所有条件都在同一批提取物里做可比性要好得多。2.3 开放式反应体系给转录因子筛选带来的自由度无细胞体系的另一个隐藏优势是可以把“表达”和“检测”放在同一个反应液滴里完成。因为反应体系是开放的你可以提前在反应液里加入荧光标记的DNA探针、目标蛋白的抗体、报告酶底物等检测工具。转录因子最常用的活性检测是DNA结合实验比如EMSA或荧光偏振这类实验如果放到常规流程里要先表达、纯化、再在管里孵育DNA和蛋白质需要好几个步骤。而在无细胞表达筛选的框架下我可以让转录因子一边被翻译出来一边与体系中的荧光DNA探针结合。蛋白一合成探针信号就会发生变化直接把“会不会表达”和“能不能结合DNA”两个问题合并成一个读出。这种设计特别适合筛选转录因子的点突变体某个位点的氨基酸改变到底会不会影响DNA结合能力过去得先纯化蛋白再逐一验证现在可以在表达阶段就批量看信号。当然这种“表达-检测”一体化模式对检测试剂的特异性要求很高抗体质量不过关、DNA探针序列不干净实验结果都会失真这一点后面说踩坑的时候再展开。3. Nuclera eProtein Discovery无细胞蛋白表达筛选系统核心解析工具最终要落到效率上。Nuclera eProtein Discovery这套无细胞蛋白表达筛选系统我看了一圈公开资料也听用过的人聊过不少它的核心思路是把无细胞表达和数字微流控结合起来用芯片取代反应管让条件的并行度和耗材成本都发生质变。3.1 数字微流控芯片把“条件矩阵”装进纳升液滴这套系统最关键的硬件是数字微流控芯片。所谓数字微流控通俗理解就是芯片上排布着密密麻麻的微小电极通过电场控制疏水表面上的独立液滴让液滴能精确移动、合并、分裂和混合。这个技术有个专门的名字叫电介质润湿EWOD即Electrowetting on Dielectric你可以把它想象成“用电压作为一双隐形的镊子在芯片表面捏出几百个微小的反应器”。做成无细胞筛选平台后芯片卡盒里预装了裂解液、能量混合液、缓冲液、辅因子和检测试剂用户只需要把DNA模板加到指定孔位软件就会自动分配液滴、组建反应组合。以前用96孔板做无细胞筛选一个孔至少需要几十微升反应液做一百个条件就得配一大管裂解物成本很高而芯片上单个反应液滴体积可以缩小到纳升到微升级别同样的试剂库存能跑出几百个独立反应通量一下子就起来了。对转录因子这种需要穷举“突变体×截短体×缓冲条件×辅因子组合”的蛋白这种体积优势不是改善体验而是直接决定实验设计能不能执行。3.2 从DNA进样到结果读出的自动化闭环Nuclera eProtein Discovery的整个工作流把一个典型的重组蛋白表达流程压缩成了“进样-设计-运行-读数”四个动作。过去做一次蛋白表达要先克隆到表达载体转化感受态细胞挑克隆摇瓶培养测表达然后裂解、纯化、再分析现在你只需要把PCR扩增好的线性表达盒纯化一下加到卡盒的样本孔里在配套软件里选好裂解液类型、金属离子组合、反应温度和时间剩下的事情交给设备。反应结束后系统可以原位读取荧光信号或发光信号也可以通过卡盒内的免疫分析模块对目标蛋白做特异检测。软件界面最终会把几百个反应的数据整理成热图或者排名列表哪个条件产量最高、哪个条件重复性最好一目了然。以我的经验这样一个“从DNA到条件排名”的闭环从加样到拿到第一轮结果通常在3到5个小时内完成。这个效率放在转录因子项目上非常有价值因为我们可以上午设计一批突变体下午就看到结果晚上就能决定第二轮怎么改。3.3 评估这类系统时我最在意的三个细节真正用的时候光看“高通量”三个字还不够我会额外关注三个细节。第一是线性模板兼容性。转录因子研究经常要测试很多截短体和突变体如果每个构建都要重新克隆到质粒里通量优势就打折了。好的系统应该直接接受PCR产物作为模板并且通过5’端加稳定结构、抑制核酸酶等方式保证线性模板在反应液里不被降解。第二个是检测模式的灵活性。有些转录因子活性不能只用总蛋白量来衡量最好系统能支持免疫检测模式用特异抗体去捕获目标蛋白这样能避免荧光融合标签干扰蛋白结构。第三个是条件的放大衔接性。芯片筛出来的最优条件能不能平稳地放大到毫升级反应决定着你后面有没有足够的蛋白做结构或活性实验。这几条在选型时比单纯看芯片通量重要得多。4. 实操记录拿一个难表达转录因子走完整筛选流程理论讲完直接上案例。假设你现在手里有一个含锌指结构域和长段无序激活域的人源转录因子代号就叫我之前做过的TF-X要制备用于后续的EMSA实验。下面这套流程是我实际跑过、也验证过可行的方案你可以直接参考。4.1 模板设计与制备先给转录因子“瘦身”第一步永远是序列分析。去UniProt和Pfam里把TF-X的结构域边界拉出来区分DNA结合域、二聚化界面、低复杂度区和无序区。对于制备DNA结合蛋白来说我的建议是不要一上来就表达全长先做几个截短突变体只保留DNA结合域的版本、DBD加一段linker的版本、带上激活域但截去断点区域的版本分别构建线性表达盒。每个表达盒的结构基本是T7启动子-5‘非翻译区-编码序列-亲和标签-3’非翻译区-终止子。线性模板通过PCR扩增产生最后用柱纯化去除引物二聚体和模板残留。这里有个小经验尽量在编码序列两端加上合适的标签比如His10或StrepII便于后续纯化也可以在N端融合sfGFP作为表达报告。但有一点要注意如果后续要用荧光偏振做DNA结合实验在靠近DBD的位置最好别加太大的标签否则空间位阻可能挡住DNA结合界面。我倾向于在远离DBD的末端加小标签并用一个GSGSG连接序列缓冲。4.2 表达条件矩阵不要凭感觉拍脑袋准备好人源TF-X的几个截短DNA模板后进入最核心的条件矩阵设计。这一步的思路是“先粗筛拉开范围再细筛收窄组合”不要一上来就盯着某一两个条件死磕。粗筛阶段我会固定模板和检测方式把下面几个变量各取几个水平做成全因子或者部分因子设计裂解液来源选大肠杆菌、麦胚、CHO三种锌离子浓度设0、0.1、0.5mM三个水平去垢剂设不加、0.05% Brij-35、0.1% Triton X-100三个水平反应温度设25度和30度两个水平反应时间设2小时和6小时两个水平。这个全因子组合加起来数目不小按传统的96孔板做试剂消耗和手工配液量大得让人头大但放到数字微流控芯片上几百个纳升液滴并行几乎谈不上额外工作量。软件里把变量填进去机器自己排布液滴组合。对照必须完整。我建议每个矩阵都包含三组基本对照阳性对照用一段容易表达的荧光报告蛋白比如sfGFP验证裂解液和能量系统有没有问题阴性对照不加DNA模板排除抗体或探针的非特异结合再加一组加翻译抑制剂如环己酰亚胺的抑制对照用于判断信号是不是真的来自翻译合成蛋白。没有这些对照的数据后面解读会很被动。4.3 上机运行与数据读取信号要分真假按软件提示把线性DNA稀释到适当浓度一般在几十纳克每微升的量级具体以系统提示为准加到样本孔卡盒推入设备选定矩阵方案启动运行。机器会在芯片上组装反应液滴恒温反应并按预设时间点读取荧光信号或进行免疫检测。结果出来之后不要只看绝对信号高低。我一般先看阳性对照信号是否正常再看阴性对照的背景有多高然后把目的蛋白的信号减去对应背景排序后结合散射光或浊度信号判断哪些是真正可溶的高表达条件。这里尤其要警惕一种情况某个条件的总蛋白量非常高但同时散射光信号也明显上升。这通常意味着蛋白形成了聚集体或者包涵体前体产量高但不可溶不适合直接用。反过来那些总产量中等但重复性好、背景散射低的组合往往才是后续纯化更顺畅的候选条件。得到粗筛排名后我会把前八到十个条件挑出来做一轮更细的梯度优化比如把锌离子浓度改成0.05、0.1、0.2、0.3mM四个梯度把GSH/GSSG的还原氧化比例从1:1调到5:1同时考虑添加伴侣蛋白混合物和0.5% CHAPS这一类温和去垢剂。每一轮优化都在芯片上重新跑数据和上一轮直接对比。4.4 条件放大与样品验证从筛选走向制备芯片筛选只能告诉我们“哪些条件值得放大”最终的蛋白制备还是要回到一定体积的反应里。把最优条件搬到1mL无细胞反应体系时有一个常被忽视的坑纳升液滴和毫升反应器的传质、供氧情况不一样不能只按体积把配方放大。我通常在放大时补加一次能量再生系统的储备液并保持低速搅拌或振荡让反应液里面的ATP和氨基酸均匀分布反应时间适当延长到四到六小时。放大反应结束后取样离心用SDS-PAGE和考马斯亮蓝染色看一眼上清和沉淀的分布。如果上清中有清晰的目标蛋白条带下一步就可以用亲和柱纯化。锌指蛋白纯化时建议在所有缓冲液里保留低浓度锌离子大约0.1mM左右防止纯化过程中金属辅因子丢失导致蛋白聚沉。纯化之后的样品一定要做活性验证对转录因子来说最直接的就是EMSA看它能不能把标记的DNA探针拉出迁移带也可以用荧光偏振法测结合常数。到了这一步整个“从难表达基因到有活性蛋白”的流程才算闭环。5. 常见问题与排查技巧实录写这部分是我最想认真说的因为很多坑我都是真金白银踩出来的。同一台平台、同一个流程不同蛋白跑出来的问题千差万别但有共性的故障集中在下面几种。5.1 一张排查表按症状找原因症状表现可能原因排查与处理建议所有反应包括阳性对照都没信号提取物失活、能量体系失效、模板没加成功先单独跑一管基础的报告蛋白表达反应排除系统和试剂问题阳性对照正常目的蛋白表达极低模板长度过长、稀有密码子过多、5’/3’端被核酸酶降解换用麦胚或CHO提取物添加核酸酶抑制剂增加反应时间到6到10小时必要时重新密码子优化产物信号高但液滴明显浑浊表达量过高导致蛋白聚集降低DNA模板用量添加0.05%到0.1%温和去垢剂加入伴侣蛋白混合物免疫检测背景高、阴性对照也有信号抗体发生非特异吸附、封闭不充分提高封闭剂浓度BSA加吐温20增加洗涤轮次把抗体浓度降下来重跑一组芯片上部分液滴变干、信号漂移卡盒保湿不足或运行时间过长检查卡盒密封和温控模块缩短连续运行时间必要时覆盖矿物油防止蒸发芯片筛选出的最优条件放大后产量下降放大体积后传质不均、能量耗竭放大反应时补加能量再生液增加振荡或搅拌延长反应时间表面活性剂浓度按经验微调这张表里我最想强调的还是第一行。做蛋白表达筛选最忌讳的是对照组不齐然后对着一个假信号分析半天。我自己的习惯是每张芯片先跑一个阳性对照确认提取物没问题后才让目的蛋白的矩阵上车。否则一旦设备或试剂出问题整个矩阵白跑浪费的时间远大于多跑一些对照的时间。5.2 几个容易忽略的细节第一个细节是金属离子的加入方式。锌指蛋白需要锌离子但直接把高浓度硫酸锌加到裂解液里很容易在中性pH附近形成氢氧化物沉淀让体系里的其他蛋白也跟着共沉淀。我后来换成锌-甘氨酸复合物或者先把锌离子配成低浓度工作液再稀释进反应体系效果明显改善。第二个细节是转录因子融合标签的位置会影响活性做DNA结合实验时尽量别把大标签直接贴在DNA结合域一侧那段恢复空间结构的时间比想象中长。第三个细节是数据保存芯片平台每次生成的数据量很大我建议统一把原始热图和导出表格按“蛋白名-构建号-日期”命名存放等优化到第二轮往回找数据时你会发现当时顺手记录的运行备注有多重要。6. 一些实操心得和扩展想法这套路走下来我现在对难表达转录因子的心态完全变了这里聊点比较个人化的体会。6.1 把无细胞筛选当“探针”而不是“量产机”无细胞表达筛选适合用来回答“我的蛋白到底能在什么条件下稳定存在”这个问题而不是用来替代大规模发酵生产。对我来说它的价值更接近一个“探针”用很小的样本消耗换取对蛋白表达边界的高密度认知。转录因子这类蛋白最不缺的就是“不确定性”一个氨基酸突变可能改变整个结构域的聚集倾向一个去垢剂浓度可能决定锌指能不能配位成型。无细胞筛的最大收益是在几天内把你对某个蛋白的“不确定性”压缩成一张可视化的条件图谱。带着这张图去做后续放大你会非常明确地知道每一步要保住什么参数。6.2 可以继续深挖的延伸方向顺着这个思路还有几个方向值得试试。一是把无细胞表达和DNA结合活性检测放在同一个液滴里做高通量变体筛选这样同一个转录因子的几十个点突变体可以直接按“表达量×结合活性”两个维度排序比逐个纯化再测EMSA快太多。二是将筛选获得的最优条件迁移到连续流动微反应体系里让转录因子在恒定能量再生条件下持续合成几个小时为后续晶体筛选或者共价小分子结合实验提供更稳定的蛋白来源。三是把无细胞表达系统和质谱检测连起来跳过亲和纯化直接从反应液里鉴定目标蛋白和共纯化相互作用分子。最后分享一个我自己的小经验如果你手里有一个做了两三个月还拿不到东西的转录因子我建议先别急着换第十个细胞株把同一个DNA模板放到无细胞平台上先跑一轮两三百个条件的矩阵再说。蛋白表达这条路最怕的不是蛋白本身难而是你一直在同一条路上反复试。换到无细胞筛选的逻辑里难表达蛋白的答案通常不是某一个“神奇条件”而是一组彼此协同的缓冲条件把这些条件找出来后续问题基本就解决一半了。