<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>ArXiv - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/arxiv/</link><description>ArXiv - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Tue, 05 May 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/arxiv/" rel="self" type="application/rss+xml"/><item><title>GroupDPO: Memory efficient Group-wise Direct Preference Optimization</title><link>https://lilfry09.github.io/ai/groupdpo-group-wise-preference-optimization/</link><pubDate>Tue, 05 May 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/groupdpo-group-wise-preference-optimization/</guid><description>GroupDPO 将 DPO 从一正一负的单对偏好扩展到多候选回答组，并通过一阶梯度等价的 surrogate loss 降低显存开销。</description></item><item><title>告别盲目堆算力：让AI编程智能体从经验中学会“思考”</title><link>https://lilfry09.github.io/ai/scaling-test-time-compute-for-agentic-coding/</link><pubDate>Tue, 05 May 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/scaling-test-time-compute-for-agentic-coding/</guid><description>本文介绍一种面向长程编程智能体的测试时扩展框架：通过结构化复盘、递归锦标赛投票和并行蒸馏提炼，让智能体复用经验而不是盲目重试。</description></item></channel></rss>