On the Off-Policy Teacher in On-Policy Distillation
同策略蒸馏中的离策略教师困局
同策略蒸馏中的离策略教师困局
半事实信用增强策略优化:瓦解 GRPO 的虚假关联
Imagine3D-LLM:让多模态大模型在作答前先构想 3D 场景
望远镜语言模型:单次训练贯通全深度算力连续谱
无心插柳的收敛:自监督置信度训练如何自发提升大模型推理效率
大模型智能体能轻易篡改自身执行轨迹
高维表征潜空间的扩散可行性之谜
Flash-dLLM:IO 感知 KV 缓存与并行解码突破扩散大模型推理瓶颈
关键状态强化学习:诊断多轮工具调用的可训练节点
Designer-RSI:从真实用户交互中进化程序性设计记忆
编码智能体 Harness 设计的实证剖析
dQwen3.5:混合注意力架构突围扩散语言模型
诺贝尔经济学奖(1969–2025)
57 postsOdoo 14开发者指南(Cookbook)第四版
24 postsOdoo 12开发者指南(Cookbook)第三版
24 postsTouchDesigner教程
20 postsPython脚本实战
18 postsOdoo 12开发手册
14 posts李宏毅机器学习2025
13 postsDwarkesh播客笔记
4 postsAndrej Karpathy LLM笔记
2 postsfreeCodeCamp
1 posts