<?xml version="1.0" encoding="UTF-8" ?>
<rss version="2.0">
    <channel>
      <title>zhaoweiguo 的知识库</title>
      <link>https://wiki.zhaoweiguo.com</link>
      <description>最近的10条笔记 on zhaoweiguo 的知识库</description>
      <generator>Quartz -- quartz.jzhao.xyz</generator>
      <item>
    <title>知识库索引</title>
    <link>https://wiki.zhaoweiguo.com/</link>
    <guid>https://wiki.zhaoweiguo.com/</guid>
    <description><![CDATA[  开源项目精选推荐与个人收藏。 Read this first to find relevant pages for any query. ]]></description>
    <pubDate>Mon, 28 Sep 2026 05:55:56 GMT</pubDate>
  </item><item>
    <title>2605.27276_sia</title>
    <link>https://wiki.zhaoweiguo.com/papers/2605.27276_sia</link>
    <guid>https://wiki.zhaoweiguo.com/papers/2605.27276_sia</guid>
    <description><![CDATA[  ]]></description>
    <pubDate>Mon, 28 Sep 2026 05:55:11 GMT</pubDate>
  </item><item>
    <title>DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale</title>
    <link>https://wiki.zhaoweiguo.com/papers/2609.22978_deepseek-elastic-compute-dsec</link>
    <guid>https://wiki.zhaoweiguo.com/papers/2609.22978_deepseek-elastic-compute-dsec</guid>
    <description><![CDATA[  一句话：DSec 是 DeepSeek 内部支撑 Agentic RL 训练的生产级沙箱平台——把”几十万个 AI 同时动手写代码、跑命令、改文件”这件事情变成可调度、可回收、可恢复的基础设施。一个生产单元覆盖约 160 个 CPU 节点，每天跑 300 万个沙箱，峰值并发 38 万，创建速度 5000+/秒。 论文：arXiv:2609.22978（2026-09-19 提交，31 页 / 13 图） 作者：DeepSeek-AI + 清华，130+ 人署名（含梁文锋），Jialiang Huang 实习期间主导 性质：这不是提出新算法的论文，而是一份生产系统技术报告——讲的是”模型训练场... ]]></description>
    <pubDate>Sun, 27 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>OpenAI Responses vs Chat Completions</title>
    <link>https://wiki.zhaoweiguo.com/concepts/openai-responses-vs-chat-completions</link>
    <guid>https://wiki.zhaoweiguo.com/concepts/openai-responses-vs-chat-completions</guid>
    <description><![CDATA[  这不是一次接口替换，而是数据模型从「消息序列」换成「条目事件序列」。 根本驱动力是模型的行为单元从「一次回复」变成了「执行一段过程」——推理模型的 CoT、多步工具调用、服务端托管状态，用 messages 数组表达不了。 演进时间线 timeline title OpenAI 模型调用接口的演进 2023-03 : Chat Completions 上线&lt;br/&gt;messages 数组成为事实标准 2023-06 : Function Calling&lt;br/&gt;工具调用塞进 assistant / tool 两条消息 2023-11 : Assistants API ... ]]></description>
    <pubDate>Wed, 23 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>XDG 规范：基础目录与规范族</title>
    <link>https://wiki.zhaoweiguo.com/concepts/xdg-spec</link>
    <guid>https://wiki.zhaoweiguo.com/concepts/xdg-spec</guid>
    <description><![CDATA[ XDG（X Desktop Group，现为 freedesktop.org）规范族定义了 Linux/Unix 桌面应用”配置文件放哪、缓存放哪、应用如何注册”的互操作约定。其中最常被引用的核心是 XDG Base Directory Specification（当前版本 0.8，2021-05-08），它解决的是”每个应用都在 $HOME 下建一个 .appname 目录，把家目录搞成垃圾场”的问题。 为什么需要它 没有 XDG 时，应用各自决定落盘位置，导致： $HOME 根目录被 ~/.app1 ~/.app2 ~/.app3 淹没，无法区分哪些能删 配置、用户数据、缓存、运行时文件混... ]]></description>
    <pubDate>Wed, 23 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>DuMateBench（智能体真实交付能力基准）</title>
    <link>https://wiki.zhaoweiguo.com/llms/benchmarks/dumatebench</link>
    <guid>https://wiki.zhaoweiguo.com/llms/benchmarks/dumatebench</guid>
    <description><![CDATA[ 一句话定位：百度搭子（DuMate）出品的「真实办公交付」Agent 基准——200 道从真实用户 session 脱敏重建的多工具工作流任务，跑在注入了故障与噪声的 Docker 环境里，最终按「产物是否真的交付出来」评分，而不是按回答对不对评分。 分数快照见 dumatebench，打榜实操见 dumatebench。 它不是 Coding Agent 榜。200 题里只有 88 道涉及代码，且多为「办公 + 编码」混合工作流。在 coding-agent-leaderboards 的分类里，它与 Terminal-Bench 同属「harness 工程证明」，不属「代码修复能力」类。 为... ]]></description>
    <pubDate>Tue, 22 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>Multi-SWE-bench（多语言 issue 修复基准）</title>
    <link>https://wiki.zhaoweiguo.com/llms/benchmarks/multi-swe-bench</link>
    <guid>https://wiki.zhaoweiguo.com/llms/benchmarks/multi-swe-bench</guid>
    <description><![CDATA[ 一句话定位：把 SWE-bench 的「读 issue 改代码」任务从 Python 扩到 7 种语言（Java / TypeScript / JavaScript / Go / Rust / C / C++），1,632 道人工双标注的真实 GitHub issue 修复题，来自 39 个仓库、由 68 名专家从 2,456 条候选中筛出（字节 Seed 出品，NeurIPS 2025 D&amp;B 收录，Apache-2.0）。 分数快照见 multi-swe-bench，打榜实操见 multi-swe-bench，横向定位见 coding-agent-leaderboards。 为什么... ]]></description>
    <pubDate>Tue, 22 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>DuMateBench 榜单（20 组 agent × 模型快照）</title>
    <link>https://wiki.zhaoweiguo.com/llms/leaderboards/dumatebench</link>
    <guid>https://wiki.zhaoweiguo.com/llms/leaderboards/dumatebench</guid>
    <description><![CDATA[ 评测集定义与方法论见 dumatebench。本页只放分数。 读榜要点：官网榜单默认是「View by harness」+ 基座模型 GPT-5.5 的切片，不是全模型平均。跨 harness 比较前先确认当前的 base model 筛选器，切换模型后名次会变（例如 OpenClaw 在 Opus-4.8 下只有 0.5821）。 官网榜（默认视图：base model = GPT-5.5，200 题） #HarnessPartial PJudge JFinal F1DuMate90.3%77.7%81.5%2Hermes90.0%76.3%80.4%3Claude Code86.1%74.... ]]></description>
    <pubDate>Tue, 22 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>Multi-SWE-bench 榜单（论文基线 + 社区提交快照）</title>
    <link>https://wiki.zhaoweiguo.com/llms/leaderboards/multi-swe-bench</link>
    <guid>https://wiki.zhaoweiguo.com/llms/leaderboards/multi-swe-bench</guid>
    <description><![CDATA[ 评测集定义与方法论见 multi-swe-bench。本页只放分数。 口径警示：榜上同时存在①论文自跑的官方移植 scaffold、②社区自提交的自研 agent，且各提交的分母不完全一致（见下）。跨条目比较只能看数量级，不能当严格同口径排名。 论文基线（2025-04，9 模型 × 3 scaffold） 语言最佳 resolved rate最佳组合Python（对照）52.20%MopenHands + Claude-3.7-SonnetJava23.44%MSWE-agent + Claude-3.7-SonnetTypeScript11.61%MopenHands + Claude-3... ]]></description>
    <pubDate>Tue, 22 Sep 2026 00:00:00 GMT</pubDate>
  </item><item>
    <title>DuMateBench 打榜指南</title>
    <link>https://wiki.zhaoweiguo.com/submission/dumatebench</link>
    <guid>https://wiki.zhaoweiguo.com/submission/dumatebench</guid>
    <description><![CDATA[ 目录入口见 README。评测集定义见 dumatebench，分数快照见 dumatebench。 先看这条：这是国内唯一”开放提交 + 直接给 harness 排名 + 公司可打”的 Agent 榜，提交走 Harbor（与 Terminal-Bench 同一框架，适配工作可复用）。但它不是 Coding Agent 榜——Code 只占 200 题里的 88 道。榜上已有 OpenCode 69.1 / OpenClaw 78.0 的现成基线，是「OpenCode 二开」类的正面对标位。门槛是 200 题 × 5 trials = 至少 1,000 次 rollout。 是什么 一句话：... ]]></description>
    <pubDate>Tue, 22 Sep 2026 00:00:00 GMT</pubDate>
  </item>
    </channel>
  </rss>