我想要找到酒馆的记忆插件

Создано: 21 мая 2026 г.

Отвечено с использованием GPT-5.5 Thinking от Chat01

Вопрос

我想要找到酒馆的记忆插件

Мысль

undefined

Мысль

Providing installation instructions with GitHub link

I need to include the answer with the plugin name "找到," and it probably helps to mention the GitHub URL. The guidelines say I can use citations as links but should avoid direct raw URLs unless asked. Since the user asked for a plugin, I'll include the GitHub repo link in code format for installation and suggest alternatives like Memory Books.

Thought for 13s

Ответ

找到了。你要的很可能是 SillyTavern 酒馆记忆增强表格插件

插件名:Memory Enhancement / 酒馆记忆增强插件
GitHub:https://github.com/muyoou/st-memory-enhancement

它是专门给 SillyTavern 酒馆 做长期记忆的插件,支持角色设定、关键事件、重要物品等结构化记忆,并用表格方式持久保存、编辑和注入上下文。(GitHub)

安装方式:在 SillyTavern 顶部进入 扩展 / Extensions,选择 安装拓展 / Install extension,粘贴上面的 GitHub 地址;SillyTavern 官方文档也说明第三方扩展可以通过 Git 仓库 URL 安装。(GitHub)

注意两点:

  1. 这个插件 README 里写了“仅在 SillyTavern 的聊天补全模式下工作”。(GitHub)
  2. 如果你只是想要内置的“找回远古聊天内容”,SillyTavern 自带 Chat Vectorization,它会从历史消息里检索相关内容放回上下文,但官方也提醒它不保证一定提升记忆效果。(SillyTavern Documentation)

另外还有一个相关插件叫 Memory Books,插件列表里描述为“自动化、结构化、可靠的记忆创建”,也可以作为备选。(GitHub)

Вопрос

我想要节省token,具体有什么方法,上面记忆插件这个管用吗,还有什么方法,给出具体操作

Мысль

undefined

Мысль

Thought for 42s

Ответ

可以。最省 token 的核心思路不是“让模型记更多”,而是:** 少发长聊天记录,多发短摘要 / 短表格 / 按需触发的世界书**。

结论:上面那个记忆插件管用吗?

管用,但前提是你把它当“压缩记忆”用;如果无脑把整张大表每回合注入,反而更费 token。

st-memory-enhancement 的作用是把长期信息保存成结构化表格,支持角色设定、事件、物品等,并且可以控制注入方式和位置。插件官方说明它支持长期记忆、自定义表格、注入控制、自动更新和表格整理。(muyoo.com.cn)
它的 README 也写明:这是 SillyTavern 的长期记忆增强表格插件,能自动生成提示词并注入上下文;但它仅在 SillyTavern 聊天补全模式下工作。(GitHub)

我的建议是:用它来替代“往前翻大量聊天记录”,但要把表格做短、定期整理,并且关闭/优化直接注入。


先做 1 件事:找到 token 到底花在哪

在 SillyTavern 里生成一条回复后,点消息的 ... 菜单,打开 Prompt Itemization。官方文档说这里可以看到最终上下文组成;上下文包括角色信息、系统提示、聊天历史等,虚线以上的消息不会发给模型。(SillyTavern Documentation)

你重点看这几项谁最大:

Character Description / Personality / Scenario
Example Messages
World Info / Lorebook
Author’s Note
Chat History
Summarize / Memory 插件注入内容

哪个最大,先砍哪个。


推荐配置:省 token 优先版

1. 降低 Context,不要盲目拉满

路径:AI Response Configuration → Common Settings → Context tokens

官方定义里,Context tokens 就是 SillyTavern 最多会发给 API 的 prompt token 数,减去回复长度;它包含角色信息、系统提示、聊天历史等。(SillyTavern Documentation)

建议值:

目标Context tokens
极省钱 / 本地小模型4096–8192
普通 RP,想省但不断片8192–12288
长剧情,稍微稳一点12288–16384
不建议省 token 时使用32768+

然后把 Response tokens 也降下来:
日常对话设 300–600;长文剧情设 800–1200。回复长度越高,模型最多生成越多,成本也越高;官方也说明 Response tokens 是 API 最多生成的回复 token。(SillyTavern Documentation)


2. 角色卡瘦身:最有效

打开角色卡,把这些字段压缩:

Description / Personality / Scenario
只保留“每回合都必须知道”的信息。不要写小说式长设定。

建议格式:

text
身份:xxx 外貌:xxx 性格:xxx 关系:xxx 当前目标:xxx 禁忌/边界:xxx

把详细世界观、人物历史、地点设定,移到 World Info / Lorebook,按关键词触发。World Info 本来就是动态插入相关条目的工具,只有关键词出现时才插入对应内容;官方也建议为了节省 prompt tokens,应保持条目内容简洁。(SillyTavern Documentation)


3. 关闭或减少 Example Messages

路径:User Settings → Chat/Message Handling → Example Messages Behavior

把它设为:

Never include examples:最省 token
Gradual push-out:折中

SillyTavern 文档列出 Example Messages Behavior 有 Gradual push-out / Always include examples / Never include examples 三种。(GitHub)
如果你的角色卡示例对话很长,关掉它通常立刻省很多。


记忆插件的具体省 token 用法

安装

路径:Extensions → Install extension
填:

text
https://github.com/muyoou/st-memory-enhancement

插件 README 里的安装步骤就是在 SillyTavern 页面点击 扩展 > 安装拓展,输入 GitHub 地址安装。(GitHub)

国内网络不稳可以用:

text
https://gitee.com/muyoou/st-memory-enhancement

设置方式一:新手先这样用

  1. 安装后正常聊天。插件文档说安装后无需额外配置,会自动应用到已有和新聊天。(muyoo.com.cn)
  2. 打开插件面板:顶栏按钮,或底栏扩展菜单里的 增强记忆表格。(muyoo.com.cn)
  3. 数据 查看表格。
  4. 手动删掉废话、重复事件、太细碎的记录。
  5. 把每条记忆压成一句话。

例如不要这样:

text
第32回合,A 看向 B,B 露出了复杂的神情,两人之间气氛微妙……

改成:

text
A 与 B 关系升温,B 已开始信任 A,但仍有戒备。

设置方式二:省 token 推荐

进入插件设置,把自动注入做轻量化

插件文档说注入方式有:按固定深度以 system/user/assistant 注入,或者关闭注入;消息模板里用 {{tableData}} 插入表格数据。(muyoo.com.cn)

建议:

注入方式:先用 @D⚙ system
深度23
消息模板:改短,只保留:

text
以下是长期记忆表,只在相关时使用,禁止逐字复述: {{tableData}}

如果表格已经很长,进一步改成:

text
仅参考与当前情节相关的长期记忆: {{tableData}}

设置方式三:进阶省 token,关闭直接注入

插件自己的最佳实践说,先手动优化注入方式,摆脱插件的直接注入;优化注入文档也说,插件直接按深度注入可能因预设和角色卡结构不同导致注意力问题,建议手动缝合到世界书或预设,但世界书和预设二选一,不要同时存在。(muyoo.com.cn)

具体做法:

  1. 插件设置里:注入方式 → 关闭注入
  2. 把插件生成的核心记忆内容,手动放到一个专门的 World Info 条目里。
  3. World Info 设关键词触发,比如:角色名、地点名、关系名。
  4. 只让相关剧情触发对应记忆,不要每回合全量注入。

这比每回合注入整张表更省。


World Info / Lorebook 的省 token 设置

路径:World Info → Activation Settings

建议:

设置推荐值
Scan Depth2–4
Context % / Budget300–800 tokens
Recursive Scan关,或 Max Recursion Steps = 1–2
常驻条目尽量少
每条内容1–3 行

官方说明:Scan Depth 决定扫描最近多少条消息;Budget 决定 World Info 一次最多占多少 token;预算耗尽后,即使关键词出现,也不会再激活更多条目。(SillyTavern Documentation)
递归扫描会让条目触发其他条目,容易越拉越多;官方也说明递归会让条目互相激活,Max Recursion Steps 可限制递归层数。(SillyTavern Documentation)

省 token 时,最重要的是:不要把大世界观设成 Always Active
用关键词触发,才省。


Summarize 扩展:很推荐

路径:Extensions → Summarize

SillyTavern 官方文档说 Summarize 默认安装在扩展面板里,可以创建、保存并使用聊天摘要;它可以被理解成一种长期记忆,但摘要可能丢细节或幻觉,所以建议手动检查和修正。(SillyTavern Documentation)

推荐设置:

设置推荐
Target summary length150–300 words
API response length300–600 tokens
Update every X messages20–40
Injection Template越短越好
No WI/AN开启,避免重复总结世界书/作者注释

官方也建议:第一次摘要最好在聊天消息开始被挤出 prompt 时生成;如果不确定间隔,可以用魔杖按钮估算。(SillyTavern Documentation)

摘要模板可改成:

text
当前剧情摘要,仅供保持连续性: {{summary}}

不要写一大段“你必须严格遵循……”之类的包装词。


Chat Vectorization:可用,但不是单纯省 token

路径:Extensions → Vector Storage → Enabled for chat messages

它会从旧聊天里找“和当前消息相关”的历史消息,插回上下文。官方说明它能找到已经超出上下文范围的相关旧消息,是一种 RAG;但官方也明确提醒:它不保证改善聊天体验或记忆。(SillyTavern Documentation)

建议用法:

  1. 开启 Enabled for chat messages
  2. 配好 Vectorization source/model。
  3. Vectorize All,把当前聊天全部向量化。官方文档也说明可以用 Vectorize All 处理当前聊天所有消息。(SillyTavern Documentation)
  4. 把 Context tokens 降低,比如从 16k 降到 8k 或 12k。
  5. 靠 Vectorization 捞旧信息,而不是一直发送完整历史。

注意:如果你的 API 支持 prompt caching,Vectorization、World Info、Summarize 这种动态 prompt 可能导致缓存命中变差。SillyTavern 官方文档特别提醒,Chat Vectorization 会重排 prompt 前缀,经常导致 cache miss;缓存和向量化最好二选一。(SillyTavern Documentation)


最推荐的一套组合

省 token、还尽量不断记忆:

  1. Context tokens:8192 或 12288
  2. Response tokens:400–800
  3. Example Messages:Never include 或 Gradual push-out
  4. 角色卡压缩到 300–800 tokens
  5. Summarize 开启,150–300 words
  6. Memory Enhancement 开启,但表格保持短
  7. Memory 插件注入模板极短,或关闭直接注入,改接 World Info
  8. World Info Scan Depth 2–4,Budget 300–800
  9. Chat Vectorization 只在你不开 prompt cache 时使用

一句话:
剧情连续性靠 Summarize,关键事实靠记忆表格,设定细节靠 World Info,旧聊天检索靠 Vectorization;不要靠超大 Context 硬塞历史。

Поделиться этим Q&A