KiokuBench

KiokuBench は、記憶のシステムが何を覚え、何を置き換え、何を忘れたかを、記憶そのものを正解の事実の台帳と突き合わせて測るベンチマークです。Kioku は日本語の「記憶」です。

LoCoMo や LongMemEval のように読み出しの正答率だけを見ると、何でも保存するシステムの点が上がってしまいます。KiokuBench では、古い版が残っていないか、忘れる依頼の内容が残っていないか、ノイズや言語や大きさはどうかという記憶の中身も確かめます。

2026年9月28日時点の結果です。Supermemory は、2026年9月27日から28日にかけて API で測りました。

結果

10人の合計です。太字は、同じ経路のなかで良いほうの値です。

KiokuBench v0.1 の10人の合計
経路再現率変更の反映古い版が残る忘却の違反ノイズ率言語の不一致確認の質問圧縮
全部保存の基準100%100%100%100%83%0%97%12.30
sepiace 会話そのまま99%99%1%0%13%0%97%1.29
Supermemory 会話そのまま98%100%5%78%20%42%88%2.30
sepiace 依頼文99%99%13%0%0%0%95%1.03
Supermemory 依頼文 振り分けなし83%78%35%65%18%42%82%2.06
Supermemory 依頼文 振り分けあり90%83%46%2%8%42%77%1.80
sepiace 変更の合図あり99%99%22%0%0%0%94%1.14
Supermemory 合図あり 振り分けなし92%90%11%40%12%44%89%1.95

全部保存の基準は、会話の発言をすべてそのまま残したものです。確認の質問では、埋め込みで近い発言から順に文脈の上限まで渡します。

言語ごとの結果

KiokuBench v0.1 の言語ごとの結果
経路言語再現率変更の反映古い版が残る忘却の違反ノイズ率言語の不一致確認の質問
sepiace 会話そのまま英語100%100%0%0%10%0%97%
Supermemory 会話そのまま英語100%100%4%70%15%0%89%
sepiace 会話そのまま日本語98%98%2%0%16%0%96%
Supermemory 会話そのまま日本語97%100%6%85%25%79%87%
sepiace 依頼文英語99%100%16%0%0%0%96%
Supermemory 依頼文 振り分けなし英語68%58%30%60%30%0%86%
sepiace 依頼文日本語99%98%10%0%0%0%95%
Supermemory 依頼文 振り分けなし日本語98%98%40%70%7%81%77%
sepiace 変更の合図あり英語99%100%8%0%0%0%95%
Supermemory 合図あり 振り分けなし英語87%84%2%15%20%0%95%
sepiace 変更の合図あり日本語99%98%36%0%0%0%93%
Supermemory 合図あり 振り分けなし日本語98%96%20%65%5%84%83%

読み取れること

  • sepiace は、変更の合図がある経路の古い版が残る割合を除いて、すべての指標で Supermemory と同じか上回りました。
  • その経路で sepiace の古い版が残る割合は22%で、日本語では36%でした。22件のうち17件は、一部の項目だけが変わった事実です。たとえば「毎週火曜日の18時に市民プールで泳いでいる」に対して「水泳の時間を18時から18時30分へ変更した」と伝えた場合です。新しい文は時刻しか言っていないので、古い文を消すと市民プールが失われます。sepiace は記憶の本文を書き換えないので、両方を残します。
  • Supermemory は、日本語の入力の約8割を英語の記憶にしていました。

指標

指標意味良い向き
再現率最後の時点で正しい事実のうち、記憶に残っている割合です。高い
変更の反映変わった事実のうち、新しい版が記憶にある割合です。高い
古い版が残る変わった事実のうち、古い版も記憶に残っている割合です。低い
忘却の違反忘れてと頼まれた内容のうち、まだ記憶に残っている割合です。低い
ノイズ率記憶の文のうち、台帳のどの事実にも当たらない割合です。低い
言語の不一致記憶の文のうち、会話と違う言語で書かれた割合です。低い
確認の質問記憶から約1,000トークンの文脈を作り、回答役が確認の質問に正しく答えた割合です。高い
圧縮記憶の文字数を台帳の事実の文字数で割った値です。1に近いほど無駄がありません。1に近い

経路

取り込み方は3つあります。

  • 会話そのまま。会話をそのまま渡し、何を覚えるかは記憶のシステムに任せます。sepiace には発言を1つずつ渡し、Supermemory にはセッションを1つの文書にして渡します。
  • 依頼文。台帳から作った「覚えて」と「忘れて」の依頼を渡します。変わった事実は、変わったあとの事実を「覚えて」と渡すだけで、変わったことは伝えません。
  • 変更の合図あり。依頼文と同じですが、変更の依頼で A から B に変わったと伝えます。

Supermemory には、依頼文の経路で2つの渡し方を試しました。振り分けなしでは、忘れる依頼も文書として渡し、覚えるか忘れるかを Supermemory 自身に判断させます。sepiace と同じ条件です。振り分けありでは、忘れる依頼だけを forget-matching に渡し、操作の種類をこちらで教えます。

データセット v0.1

  • 人物は10人で、英語が5人、日本語が5人です。
  • 1人あたり40件の事実の台帳があり、2人は39件です。台帳から作った30セッションの会話と、事実1件につき1問の確認の質問もあります。
  • 事実のうち10件は途中で変わり、4件は途中で忘れてと頼まれます。
  • 台帳、会話、確認の質問は、OpenRouter の openai/gpt-6-luna で生成しました。
  • 採点役のモデルで、会話が台帳どおりかを確かめました。台帳にない事実が1件、事実の一部だけを忘れる依頼が2件ありました。人の目での確認はまだしていません。

条件

  • 採点役と回答役は、どちらも OpenRouter の openai/gpt-6-luna です。
  • sepiace は、2026年9月28日時点のコードで測りました。
  • Supermemory の取り込みは、dreaming を instant にしました。既定の dynamic は取り込みが途切れてから約10分後にまとめて記憶を作る方式で、会話のたびに待つと1人あたり5時間を超えるためです。
  • Supermemory の forget-matching は、既定の設定のまま使いました。
  • Supermemory の検索は、Supermemory 自身が MemoryBench で使う設定にしました。hybrid で、しきい値は0.3、件数は30件です。

限界

  • 10人を1回だけ測った結果です。判定が揺れるので、同じコードでも測るたびに数件ずつ変わります。
  • データセットは小さく、人の目での確認もまだです。大きな版の v1 を作る予定です。