AI论文简报
搜索
方法论
公众号
EN
全流程FP8强化学习中的负优势token梯度丢失
从195篇论文中选出8篇
重点关注
OmniEdu: Open Foundation Models for Learning and Teaching
score 10
入选 HF Daily Papers;HF 热度: 66 upvotes (+4);有代码实现;关键词(2): fine-tune, reasoning
UltraTex: Unleashing 2K Multi-View Diffusion for 3D Texturing
score 6
入选 HF Daily Papers;有代码实现;关键词(3): scaling, production, latency
Towards Full Pipeline FP8 Reinforcement Learning for LLMs
score 5
入选 HF Daily Papers;HF 热度: 4 upvotes (+1);关键词(5): scaling, quantization, GRPO, agentic, reasoning
也值得关注
OptiSkill: A Hierarchical and Evolving SkillBank for LLM-Based Optimization Modeling
score 4
关键词(1): agentic;顶会接收: EMNLP
Inherit4Rec: Parameter Inheritance for Efficient Scaling of Recommendation Models
score 4
机构: Huawei;关键词(2): scaling, serving
Beyond Average Error through Oracle-Informed Stress Tests for Time-Series Forecasting
score 3
机构: Tsinghua
Rethinking Pivot Programming Languages in Code Language Models
score 3
顶会接收: EMNLP
MolSC: Leveraging Substituent Contributions to Enhance Fine-grained Molecular Understanding in LLMs
score 3
顶会接收: EMNLP