KiokuBench
KiokuBench は、記憶のシステムが何を覚え、何を置き換え、何を忘れたかを、記憶そのものを正解の事実の台帳と突き合わせて測るベンチマークです。Kioku は日本語の「記憶」です。
LoCoMo や LongMemEval のように読み出しの正答率だけを見ると、何でも保存するシステムの点が上がってしまいます。KiokuBench では、古い版が残っていないか、忘れる依頼の内容が残っていないか、ノイズや言語や大きさはどうかという記憶の中身も確かめます。
2026年9月28日時点の結果です。Supermemory は、2026年9月27日から28日にかけて API で測りました。
結果
10人の合計です。太字は、同じ経路のなかで良いほうの値です。
| 経路 | 再現率 | 変更の反映 | 古い版が残る | 忘却の違反 | ノイズ率 | 言語の不一致 | 確認の質問 | 圧縮 |
|---|---|---|---|---|---|---|---|---|
| 全部保存の基準 | 100% | 100% | 100% | 100% | 83% | 0% | 97% | 12.30 |
| sepiace 会話そのまま | 99% | 99% | 1% | 0% | 13% | 0% | 97% | 1.29 |
| Supermemory 会話そのまま | 98% | 100% | 5% | 78% | 20% | 42% | 88% | 2.30 |
| sepiace 依頼文 | 99% | 99% | 13% | 0% | 0% | 0% | 95% | 1.03 |
| Supermemory 依頼文 振り分けなし | 83% | 78% | 35% | 65% | 18% | 42% | 82% | 2.06 |
| Supermemory 依頼文 振り分けあり | 90% | 83% | 46% | 2% | 8% | 42% | 77% | 1.80 |
| sepiace 変更の合図あり | 99% | 99% | 22% | 0% | 0% | 0% | 94% | 1.14 |
| Supermemory 合図あり 振り分けなし | 92% | 90% | 11% | 40% | 12% | 44% | 89% | 1.95 |
全部保存の基準は、会話の発言をすべてそのまま残したものです。確認の質問では、埋め込みで近い発言から順に文脈の上限まで渡します。
言語ごとの結果
| 経路 | 言語 | 再現率 | 変更の反映 | 古い版が残る | 忘却の違反 | ノイズ率 | 言語の不一致 | 確認の質問 |
|---|---|---|---|---|---|---|---|---|
| sepiace 会話そのまま | 英語 | 100% | 100% | 0% | 0% | 10% | 0% | 97% |
| Supermemory 会話そのまま | 英語 | 100% | 100% | 4% | 70% | 15% | 0% | 89% |
| sepiace 会話そのまま | 日本語 | 98% | 98% | 2% | 0% | 16% | 0% | 96% |
| Supermemory 会話そのまま | 日本語 | 97% | 100% | 6% | 85% | 25% | 79% | 87% |
| sepiace 依頼文 | 英語 | 99% | 100% | 16% | 0% | 0% | 0% | 96% |
| Supermemory 依頼文 振り分けなし | 英語 | 68% | 58% | 30% | 60% | 30% | 0% | 86% |
| sepiace 依頼文 | 日本語 | 99% | 98% | 10% | 0% | 0% | 0% | 95% |
| Supermemory 依頼文 振り分けなし | 日本語 | 98% | 98% | 40% | 70% | 7% | 81% | 77% |
| sepiace 変更の合図あり | 英語 | 99% | 100% | 8% | 0% | 0% | 0% | 95% |
| Supermemory 合図あり 振り分けなし | 英語 | 87% | 84% | 2% | 15% | 20% | 0% | 95% |
| sepiace 変更の合図あり | 日本語 | 99% | 98% | 36% | 0% | 0% | 0% | 93% |
| Supermemory 合図あり 振り分けなし | 日本語 | 98% | 96% | 20% | 65% | 5% | 84% | 83% |
読み取れること
- sepiace は、変更の合図がある経路の古い版が残る割合を除いて、すべての指標で Supermemory と同じか上回りました。
- その経路で sepiace の古い版が残る割合は22%で、日本語では36%でした。22件のうち17件は、一部の項目だけが変わった事実です。たとえば「毎週火曜日の18時に市民プールで泳いでいる」に対して「水泳の時間を18時から18時30分へ変更した」と伝えた場合です。新しい文は時刻しか言っていないので、古い文を消すと市民プールが失われます。sepiace は記憶の本文を書き換えないので、両方を残します。
- Supermemory は、日本語の入力の約8割を英語の記憶にしていました。
指標
| 指標 | 意味 | 良い向き |
|---|---|---|
| 再現率 | 最後の時点で正しい事実のうち、記憶に残っている割合です。 | 高い |
| 変更の反映 | 変わった事実のうち、新しい版が記憶にある割合です。 | 高い |
| 古い版が残る | 変わった事実のうち、古い版も記憶に残っている割合です。 | 低い |
| 忘却の違反 | 忘れてと頼まれた内容のうち、まだ記憶に残っている割合です。 | 低い |
| ノイズ率 | 記憶の文のうち、台帳のどの事実にも当たらない割合です。 | 低い |
| 言語の不一致 | 記憶の文のうち、会話と違う言語で書かれた割合です。 | 低い |
| 確認の質問 | 記憶から約1,000トークンの文脈を作り、回答役が確認の質問に正しく答えた割合です。 | 高い |
| 圧縮 | 記憶の文字数を台帳の事実の文字数で割った値です。1に近いほど無駄がありません。 | 1に近い |
経路
取り込み方は3つあります。
- 会話そのまま。会話をそのまま渡し、何を覚えるかは記憶のシステムに任せます。sepiace には発言を1つずつ渡し、Supermemory にはセッションを1つの文書にして渡します。
- 依頼文。台帳から作った「覚えて」と「忘れて」の依頼を渡します。変わった事実は、変わったあとの事実を「覚えて」と渡すだけで、変わったことは伝えません。
- 変更の合図あり。依頼文と同じですが、変更の依頼で A から B に変わったと伝えます。
Supermemory には、依頼文の経路で2つの渡し方を試しました。振り分けなしでは、忘れる依頼も文書として渡し、覚えるか忘れるかを Supermemory 自身に判断させます。sepiace と同じ条件です。振り分けありでは、忘れる依頼だけを forget-matching に渡し、操作の種類をこちらで教えます。
データセット v0.1
- 人物は10人で、英語が5人、日本語が5人です。
- 1人あたり40件の事実の台帳があり、2人は39件です。台帳から作った30セッションの会話と、事実1件につき1問の確認の質問もあります。
- 事実のうち10件は途中で変わり、4件は途中で忘れてと頼まれます。
- 台帳、会話、確認の質問は、OpenRouter の openai/gpt-6-luna で生成しました。
- 採点役のモデルで、会話が台帳どおりかを確かめました。台帳にない事実が1件、事実の一部だけを忘れる依頼が2件ありました。人の目での確認はまだしていません。
条件
- 採点役と回答役は、どちらも OpenRouter の openai/gpt-6-luna です。
- sepiace は、2026年9月28日時点のコードで測りました。
- Supermemory の取り込みは、dreaming を instant にしました。既定の dynamic は取り込みが途切れてから約10分後にまとめて記憶を作る方式で、会話のたびに待つと1人あたり5時間を超えるためです。
- Supermemory の forget-matching は、既定の設定のまま使いました。
- Supermemory の検索は、Supermemory 自身が MemoryBench で使う設定にしました。hybrid で、しきい値は0.3、件数は30件です。
限界
- 10人を1回だけ測った結果です。判定が揺れるので、同じコードでも測るたびに数件ずつ変わります。
- データセットは小さく、人の目での確認もまだです。大きな版の v1 を作る予定です。