我想要找到酒馆的记忆插件
Tạo vào: 21 tháng 5, 2026
Trả lời bằng GPT-5.5 Thinking bởi Chat01
Tạo vào: 21 tháng 5, 2026
Trả lời bằng GPT-5.5 Thinking bởi Chat01
我想要找到酒馆的记忆插件
找到了。你要的很可能是 SillyTavern 酒馆记忆增强表格插件:
插件名:Memory Enhancement / 酒馆记忆增强插件
GitHub:https://github.com/muyoou/st-memory-enhancement
它是专门给 SillyTavern 酒馆 做长期记忆的插件,支持角色设定、关键事件、重要物品等结构化记忆,并用表格方式持久保存、编辑和注入上下文。(GitHub)
安装方式:在 SillyTavern 顶部进入 扩展 / Extensions,选择 安装拓展 / Install extension,粘贴上面的 GitHub 地址;SillyTavern 官方文档也说明第三方扩展可以通过 Git 仓库 URL 安装。(GitHub)
注意两点:
另外还有一个相关插件叫 Memory Books,插件列表里描述为“自动化、结构化、可靠的记忆创建”,也可以作为备选。(GitHub)
我想要节省token,具体有什么方法,上面记忆插件这个管用吗,还有什么方法,给出具体操作
可以。最省 token 的核心思路不是“让模型记更多”,而是:** 少发长聊天记录,多发短摘要 / 短表格 / 按需触发的世界书**。
管用,但前提是你把它当“压缩记忆”用;如果无脑把整张大表每回合注入,反而更费 token。
st-memory-enhancement 的作用是把长期信息保存成结构化表格,支持角色设定、事件、物品等,并且可以控制注入方式和位置。插件官方说明它支持长期记忆、自定义表格、注入控制、自动更新和表格整理。(muyoo.com.cn)
它的 README 也写明:这是 SillyTavern 的长期记忆增强表格插件,能自动生成提示词并注入上下文;但它仅在 SillyTavern 聊天补全模式下工作。(GitHub)
我的建议是:用它来替代“往前翻大量聊天记录”,但要把表格做短、定期整理,并且关闭/优化直接注入。
在 SillyTavern 里生成一条回复后,点消息的 ... 菜单,打开 Prompt Itemization。官方文档说这里可以看到最终上下文组成;上下文包括角色信息、系统提示、聊天历史等,虚线以上的消息不会发给模型。(SillyTavern Documentation)
你重点看这几项谁最大:
Character Description / Personality / Scenario
Example Messages
World Info / Lorebook
Author’s Note
Chat History
Summarize / Memory 插件注入内容
哪个最大,先砍哪个。
路径:AI Response Configuration → Common Settings → Context tokens
官方定义里,Context tokens 就是 SillyTavern 最多会发给 API 的 prompt token 数,减去回复长度;它包含角色信息、系统提示、聊天历史等。(SillyTavern Documentation)
建议值:
| 目标 | Context tokens |
|---|---|
| 极省钱 / 本地小模型 | 4096–8192 |
| 普通 RP,想省但不断片 | 8192–12288 |
| 长剧情,稍微稳一点 | 12288–16384 |
| 不建议省 token 时使用 | 32768+ |
然后把 Response tokens 也降下来:
日常对话设 300–600;长文剧情设 800–1200。回复长度越高,模型最多生成越多,成本也越高;官方也说明 Response tokens 是 API 最多生成的回复 token。(SillyTavern Documentation)
打开角色卡,把这些字段压缩:
Description / Personality / Scenario
只保留“每回合都必须知道”的信息。不要写小说式长设定。
建议格式:
text身份:xxx 外貌:xxx 性格:xxx 关系:xxx 当前目标:xxx 禁忌/边界:xxx
把详细世界观、人物历史、地点设定,移到 World Info / Lorebook,按关键词触发。World Info 本来就是动态插入相关条目的工具,只有关键词出现时才插入对应内容;官方也建议为了节省 prompt tokens,应保持条目内容简洁。(SillyTavern Documentation)
路径:User Settings → Chat/Message Handling → Example Messages Behavior
把它设为:
Never include examples:最省 token
或 Gradual push-out:折中
SillyTavern 文档列出 Example Messages Behavior 有 Gradual push-out / Always include examples / Never include examples 三种。(GitHub)
如果你的角色卡示例对话很长,关掉它通常立刻省很多。
路径:Extensions → Install extension
填:
texthttps://github.com/muyoou/st-memory-enhancement
插件 README 里的安装步骤就是在 SillyTavern 页面点击 扩展 > 安装拓展,输入 GitHub 地址安装。(GitHub)
国内网络不稳可以用:
texthttps://gitee.com/muyoou/st-memory-enhancement
增强记忆表格。(muyoo.com.cn)数据 查看表格。例如不要这样:
text第32回合,A 看向 B,B 露出了复杂的神情,两人之间气氛微妙……
改成:
textA 与 B 关系升温,B 已开始信任 A,但仍有戒备。
进入插件设置,把自动注入做轻量化。
插件文档说注入方式有:按固定深度以 system/user/assistant 注入,或者关闭注入;消息模板里用 {{tableData}} 插入表格数据。(muyoo.com.cn)
建议:
注入方式:先用 @D⚙ system
深度:2 或 3
消息模板:改短,只保留:
text以下是长期记忆表,只在相关时使用,禁止逐字复述: {{tableData}}
如果表格已经很长,进一步改成:
text仅参考与当前情节相关的长期记忆: {{tableData}}
插件自己的最佳实践说,先手动优化注入方式,摆脱插件的直接注入;优化注入文档也说,插件直接按深度注入可能因预设和角色卡结构不同导致注意力问题,建议手动缝合到世界书或预设,但世界书和预设二选一,不要同时存在。(muyoo.com.cn)
具体做法:
这比每回合注入整张表更省。
路径:World Info → Activation Settings
建议:
| 设置 | 推荐值 |
|---|---|
| Scan Depth | 2–4 |
| Context % / Budget | 300–800 tokens |
| Recursive Scan | 关,或 Max Recursion Steps = 1–2 |
| 常驻条目 | 尽量少 |
| 每条内容 | 1–3 行 |
官方说明:Scan Depth 决定扫描最近多少条消息;Budget 决定 World Info 一次最多占多少 token;预算耗尽后,即使关键词出现,也不会再激活更多条目。(SillyTavern Documentation)
递归扫描会让条目触发其他条目,容易越拉越多;官方也说明递归会让条目互相激活,Max Recursion Steps 可限制递归层数。(SillyTavern Documentation)
省 token 时,最重要的是:不要把大世界观设成 Always Active。
用关键词触发,才省。
路径:Extensions → Summarize
SillyTavern 官方文档说 Summarize 默认安装在扩展面板里,可以创建、保存并使用聊天摘要;它可以被理解成一种长期记忆,但摘要可能丢细节或幻觉,所以建议手动检查和修正。(SillyTavern Documentation)
推荐设置:
| 设置 | 推荐 |
|---|---|
| Target summary length | 150–300 words |
| API response length | 300–600 tokens |
| Update every X messages | 20–40 |
| Injection Template | 越短越好 |
| No WI/AN | 开启,避免重复总结世界书/作者注释 |
官方也建议:第一次摘要最好在聊天消息开始被挤出 prompt 时生成;如果不确定间隔,可以用魔杖按钮估算。(SillyTavern Documentation)
摘要模板可改成:
text当前剧情摘要,仅供保持连续性: {{summary}}
不要写一大段“你必须严格遵循……”之类的包装词。
路径:Extensions → Vector Storage → Enabled for chat messages
它会从旧聊天里找“和当前消息相关”的历史消息,插回上下文。官方说明它能找到已经超出上下文范围的相关旧消息,是一种 RAG;但官方也明确提醒:它不保证改善聊天体验或记忆。(SillyTavern Documentation)
建议用法:
Enabled for chat messages。Vectorize All,把当前聊天全部向量化。官方文档也说明可以用 Vectorize All 处理当前聊天所有消息。(SillyTavern Documentation)注意:如果你的 API 支持 prompt caching,Vectorization、World Info、Summarize 这种动态 prompt 可能导致缓存命中变差。SillyTavern 官方文档特别提醒,Chat Vectorization 会重排 prompt 前缀,经常导致 cache miss;缓存和向量化最好二选一。(SillyTavern Documentation)
省 token、还尽量不断记忆:
一句话:
剧情连续性靠 Summarize,关键事实靠记忆表格,设定细节靠 World Info,旧聊天检索靠 Vectorization;不要靠超大 Context 硬塞历史。