网站Logo 风铃的个人博客
首页
科研记录生活情感
科研学习
个人随想
生活情感
temp trival
登录
《动手学强化学习》阅读

《动手学强化学习》阅读

一些有用的书中句子摘抄。 初探强化学习 强化学习用智能体(agent)这个概念来表示做决策的机器。相比于有监督学习中的“模型”,强化学习中的“智能体”强调机器不但可以感知周围的环境信息,还可以通过做决策来直接改变这个环境,而不只是给出一些预测信号。 智能体有3种关键要素,即感知、决策和奖励。 感知。

2026-01-25
14
0
科研记录
《动手学强化学习》阅读

智能体与强化学习

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-I

2026-01-24
8
0
科研记录
智能体与强化学习
智能体与强化学习
Weekly Update List

Weekly Update List

记录一下自己这周该做的事以及博客更新的内容,希望能督促学习。 科研碎碎念——关于pipeline的思考 阅读笔记

2025-11-27
16
0
科研记录
Weekly Update List

暂记最新的一些有意思的文章集合

搜论文时发现的,记录一下。 PISanitizer: Preventing Prompt Injection to Long‑Context LLMs via Prompt Sanitization 针对长上下文 (long-context) LLM 的防御方法。当 context 很长时,恶意注入

2025-11-23
28
0
科研记录
暂记最新的一些有意思的文章集合
暂记最新的一些有意思的文章集合
科研碎碎念

科研碎碎念

碎碎念1.0 Language Models Resist Alignment: Evidence From Data Compression ACL2025最佳论文,值得好好follow。作者是亲爱的YaoDong Yang

2025-11-17
38
0
科研记录
科研碎碎念

Agent自进化相关(攻击,工具调用)

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs [2410.05295] AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Explora

2025-10-24
52
0
科研记录
Agent自进化相关(攻击,工具调用)
Agent自进化相关(攻击,工具调用)
关于智能体的自进化(self-evolving agents)

关于智能体的自进化(self-evolving agents)

老师推荐的两篇相关方向论文: Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [2510.04860] Alignment Tipping Process: How Self-Evolutio

2025-10-09
53
0
科研记录
关于智能体的自进化(self-evolving agents)

关于强化学习

[2509.08827] A Survey of Reinforcement Learning for Large Reasoning Models (arxiv.org) 一个不错的综述可以帮助快速入门,梳理强化学习脉络,下面是阅读笔记。 引言部分 强化学习最初是作为人类对齐的后训练,后面声名鹤起

2025-10-06
30
0
科研记录
关于强化学习
关于强化学习
Paper阅读记录

Paper阅读记录

部分好文阅读笔记:大模型安全、AI自动化框架、具身智能

2025-10-05
19
0
科研记录
Paper阅读记录