原标题:《Continuous Diffusion Language Models (CDLM's)》 评分: 122 | 作者: peter_d_sherman 💭 把出 token 搞复杂点,就算范式革命? 🎯 讨论背景 这篇文章讨论 continuous diffusion language models(CDLMs,连续 diffusion 语言模型),它试图把 diffusion(扩散式逐步去噪生成)用于文本而不是图像。评论区因此回到了语言模型路线之争:autoregressive(自回归)生成、BERT(双向编码器表示模型)式 fine-tuning,以及后来以 RLHF(基于人类反馈的强化学习)和 DPO(Direct Preference Optimization,偏好优化方法)为代表的 post-training(后训练)。不少人把 GPT-2、GPT-3 当作历史参照,讨论早期模型发布为何引发安全争论,以及研究圈在 ChatGPT 之前对非自回归方法的接受度。另一些评论则把话题延伸到 scratchpad、agent harness(代理控制框架)和 trans