Decoupling Exploration from Optimization in RLVR
解耦 RLVR 中的探索与优化:ExpDis 框架如何激发大模型推理多样性
解耦 RLVR 中的探索与优化:ExpDis 框架如何激发大模型推理多样性
EngramEdit:利用条件记忆解耦大语言模型的事实知识编辑
装瓶智能体:大模型能否将自身能力编译为廉价高效的复用制品?
世界模型的物理学终考:基于物理测量的严苛基准检验
基座大模型本就会推理:前缀提示词如何激活预训练的思维潜能
CLIFT:基于共形自验证的网页智能体训练与测试期扩展
LESSER:用输出层梯度实现低成本大模型后训练数据选择
世界模型应该遗忘什么?持续适应中的分层保留范式
同策略蒸馏中的离策略教师困局
半事实信用增强策略优化:瓦解 GRPO 的虚假关联
Imagine3D-LLM:让多模态大模型在作答前先构想 3D 场景
望远镜语言模型:单次训练贯通全深度算力连续谱
诺贝尔经济学奖(1969–2025)
57 postsOdoo 14开发者指南(Cookbook)第四版
24 postsOdoo 12开发者指南(Cookbook)第三版
24 postsTouchDesigner教程
20 postsPython脚本实战
18 postsOdoo 12开发手册
14 posts李宏毅机器学习2025
13 postsDwarkesh播客笔记
4 postsAndrej Karpathy LLM笔记
2 postsfreeCodeCamp
1 posts