<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Posts on CYR&#39;ML</title>
    <link>https://chengyongru.github.io/blog/</link>
    <description>Recent content in Posts on CYR&#39;ML</description>
    <generator>Hugo</generator>
    <language>en-us</language>
    <lastBuildDate>Tue, 21 Jul 2026 13:43:36 +0800</lastBuildDate>
    <atom:link href="https://chengyongru.github.io/blog/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>一次 Ollama 工具调用缓存问题的排查</title>
      <link>https://chengyongru.github.io/blog/notebook/%E4%B8%80%E6%AC%A1%20ollama%20%E5%B7%A5%E5%85%B7%E8%B0%83%E7%94%A8%E7%BC%93%E5%AD%98%E9%97%AE%E9%A2%98%E7%9A%84%E6%8E%92%E6%9F%A5/</link>
      <pubDate>Mon, 20 Jul 2026 11:14:37 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/%E4%B8%80%E6%AC%A1%20ollama%20%E5%B7%A5%E5%85%B7%E8%B0%83%E7%94%A8%E7%BC%93%E5%AD%98%E9%97%AE%E9%A2%98%E7%9A%84%E6%8E%92%E6%9F%A5/</guid>
      <description>&lt;p&gt;&lt;a href=&#34;https://github.com/HKUDS/nanobot/issues/4867&#34;&gt;nanobot #4867&lt;/a&gt; 最初看起来已经解决了。&lt;/p&gt;
&lt;p&gt;The-Markitecht 报告说，同一个 &lt;code&gt;llama3.1:8b&lt;/code&gt;，直接通过 Ollama 调用很快；经过 nanobot 后，一轮对话却可能多花几十秒。日志中最明显的差别来自缓存：直接调用时，第二个请求能复用大部分 prompt；nanobot 的第二轮主请求只能复用四成左右。&lt;/p&gt;</description>
    </item>
    <item>
      <title>Why we prompt?</title>
      <link>https://chengyongru.github.io/blog/notebook/why%20we%20prompt/</link>
      <pubDate>Thu, 18 Jun 2026 11:00:00 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/why%20we%20prompt/</guid>
      <description>&lt;h1 id=&#34;why-we-prompt&#34;&gt;Why we prompt?&lt;/h1&gt;
&lt;p&gt;2023 年 2 月 24 日是我第一次使用大模型。那时我刚开始学 C++，GPT-3.5 给了我不小的震撼。“What is xxx?” 大概是那一年我最常用的开场白。&lt;/p&gt;</description>
    </item>
    <item>
      <title>关于 Claw-SWE-Bench</title>
      <link>https://chengyongru.github.io/blog/notebook/%E5%85%B3%E4%BA%8Eclaw%20bench/</link>
      <pubDate>Fri, 12 Jun 2026 18:03:38 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/%E5%85%B3%E4%BA%8Eclaw%20bench/</guid>
      <description>&lt;p&gt;最近沉迷 agent，所以对相关论文和 bench 比较感兴趣。下面这篇是我最近看到的比较炸裂的一篇。&lt;/p&gt;
&lt;p&gt;&lt;a href=&#34;https://arxiv.org/html/2606.12344v1&#34;&gt;https://arxiv.org/html/2606.12344v1&lt;/a&gt;
&lt;a href=&#34;https://github.com/opensquilla/claw-swe-bench&#34;&gt;https://github.com/opensquilla/claw-swe-bench&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;我的结论很简单：这篇可以看看 bench 设计思路，但是实验结论基本没什么意义。原因也很直接：论文把单次运行、混杂对比和不完整实验网格写成了看起来很确定的结论。作者明知每个组合只跑一次，还在正文里讨论排名、机制和框架优劣，多多少少有点让我脑内自动浮现派大星翻白眼流哈喇子表情包。&lt;/p&gt;</description>
    </item>
    <item>
      <title>cron 和 session 的关系</title>
      <link>https://chengyongru.github.io/blog/notebook/cron%20%E5%92%8C%20session%20%E7%9A%84%E5%85%B3%E7%B3%BB/</link>
      <pubDate>Thu, 11 Jun 2026 16:47:16 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/cron%20%E5%92%8C%20session%20%E7%9A%84%E5%85%B3%E7%B3%BB/</guid>
      <description>&lt;p&gt;之前 nanobot 的 &lt;code&gt;cron&lt;/code&gt; 把结果发到聊天窗口后，这条消息并不会进入这个窗口的上下文。&lt;/p&gt;
&lt;p&gt;假设有个定时任务每天早上查天气，9:30 告诉我：“今天会下雨。”我顺手回一句：“太糟了。”agent 却问：“什么太糟了？”&lt;/p&gt;</description>
    </item>
    <item>
      <title>恶意脚本检测中的分块聚合与 MIL</title>
      <link>https://chengyongru.github.io/blog/notebook/%E6%81%B6%E6%84%8F%E8%84%9A%E6%9C%AC%E6%A3%80%E6%B5%8B%E4%B8%AD%E7%9A%84%E5%88%86%E5%9D%97%E8%81%9A%E5%90%88%E4%B8%8E%20mil/</link>
      <pubDate>Tue, 03 Feb 2026 14:07:17 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/%E6%81%B6%E6%84%8F%E8%84%9A%E6%9C%AC%E6%A3%80%E6%B5%8B%E4%B8%AD%E7%9A%84%E5%88%86%E5%9D%97%E8%81%9A%E5%90%88%E4%B8%8E%20mil/</guid>
      <description>&lt;p&gt;恶意脚本检测有一个很实际的问题：真正有问题的代码可能只占一小段。脚本整体很长，但危险行为往往集中在某几行，例如解码、下载、执行或跳转。如果直接把长脚本截断成固定长度输入，就有可能把关键负载切掉，模型最后是在一段看起来正常的文本上学习“恶意”标签。&lt;/p&gt;</description>
    </item>
    <item>
      <title>基于 LIEF 的 PE 解析死循环排查</title>
      <link>https://chengyongru.github.io/blog/notebook/%E5%85%B3%E4%BA%8E%20lief%20%E5%BA%93%E8%A7%A3%E6%9E%90%20pe%20%E6%96%87%E4%BB%B6%E6%AD%BB%E5%BE%AA%E7%8E%AF%E9%97%AE%E9%A2%98%E7%9A%84%E6%8E%92%E6%9F%A5%E4%B8%8E%E5%88%86%E6%9E%90/</link>
      <pubDate>Fri, 28 Nov 2025 11:44:57 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/%E5%85%B3%E4%BA%8E%20lief%20%E5%BA%93%E8%A7%A3%E6%9E%90%20pe%20%E6%96%87%E4%BB%B6%E6%AD%BB%E5%BE%AA%E7%8E%AF%E9%97%AE%E9%A2%98%E7%9A%84%E6%8E%92%E6%9F%A5%E4%B8%8E%E5%88%86%E6%9E%90/</guid>
      <description>&lt;p&gt;在对抗性样本的特征工程流水线里，解析稳定性比性能更早暴露问题。最近处理一批大规模 PE 样本时，我的特征提取器偶发卡住：跑到几万个样本后，某些子进程停在原地，CPU 单核打满，&lt;code&gt;tqdm&lt;/code&gt; 进度条也不再前进。&lt;/p&gt;</description>
    </item>
    <item>
      <title>强化学习基础：从回报定义到贝尔曼方程的推导</title>
      <link>https://chengyongru.github.io/blog/notebook/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%85%A5%E9%97%A8%E4%B9%8B%E8%B7%AF0/</link>
      <pubDate>Thu, 20 Nov 2025 01:17:02 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E5%85%A5%E9%97%A8%E4%B9%8B%E8%B7%AF0/</guid>
      <description>&lt;p&gt;假设我们要构建一个 Agent，在谈 Policy 或 Action 之前，先要回答一个问题：目标怎么量化，又怎么让机器使用这个量化结果？&lt;/p&gt;
&lt;p&gt;在强化学习里，这个介质就是 Reward。&lt;/p&gt;
&lt;h2 id=&#34;奖励与轨迹&#34;&gt;奖励与轨迹&lt;/h2&gt;
&lt;p&gt;在这个框架下，我更愿意把 Reward 看成我们和 Agent 沟通的语言。我们通过设计 Reward 函数来引导 Agent 的行为。这里有一个容易忽略的点：在强化学习语境下，“没有奖励”本身也可能是一种惩罚，比如时间流逝带来的代价；反过来也一样。这些情况在数学上可以统一处理。&lt;/p&gt;</description>
    </item>
    <item>
      <title>从递归到非递归</title>
      <link>https://chengyongru.github.io/blog/notebook/%E4%BB%8E%E9%80%92%E5%BD%92%E5%88%B0%E9%9D%9E%E9%80%92%E5%BD%92/</link>
      <pubDate>Sat, 23 Sep 2023 16:00:05 +0800</pubDate>
      <guid>https://chengyongru.github.io/blog/notebook/%E4%BB%8E%E9%80%92%E5%BD%92%E5%88%B0%E9%9D%9E%E9%80%92%E5%BD%92/</guid>
      <description>&lt;p&gt;jyy 在操作系统课上讲到这部分时，对我冲击很大。它让我重新想了一遍：程序到底是什么，函数调用到底发生了什么。&lt;/p&gt;
&lt;p&gt;我以前一直觉得自己知道什么叫递归，也能手写一些把递归转换成非递归的算法。但很多时候，这只是学会了别人怎么做，并没有真正想清楚为什么能这么做。从汇编和运行时栈的角度看，这个问题会更具体。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
