Encoder 的卷土重来
BERT 本来是一条极有潜力的路线:高效地把输入压成 representation。但它停留在了 task-specific 时代,每个任务都需要微调。
GPT 早期同样如此,后来却沿着 scaling、in-context learning 和 instruction tuning 走向了 泛化,把自然语言变成 universal task interface。分类、判断、推理、工具调用,统统变成 generation。
于是 decoder-only 赢下了整个 paradigm,encoder 也失去了继续探索 general classifier 和 general representation model 的历史机会。
但 Agent 改变了 workload。模型开始面对越来越大的输入、越来越重的 KV cache、越来越频繁的循环调用,此时,用一个巨大的 decoder 完整 prefill,再 autoregressive decode 几个 token 来完成一次判断,开始显得昂贵。
Jev 恰好等到了这个窗口。它试图补上 BERT 当年没有走完的路线,保留 GPT 的 task generalization,同时重新获得 encoder 和 classifier 式的 decision efficiency,成为面向 service、面向 Agent 的 泛化 decision model。