残り5段階の実装・検証記録

2026-09-22。8章の続きとして、比較評価、訂正の継続、観客反応による展開、実音声・映像での調整、限定導入を進める。

段階 完了条件 現在の状態
1. 比較評価 同じ入力・状況を反復し、生成結果と実効条件・待ち時間・見送りを比較できる リプレイ・計測・比較画面を実装、自動検証済み。実モデル比較待ち
2. 訂正 特定語彙に依存せず、同一相手の参照先と後続発話を照合できる 複数往復の保持・公開と判断方針を実装。意味理解の実モデル評価待ち
3. 観客反応と展開 関連する反応を根拠に続きと説明量を選び、反復・未取得反応の創作を避ける 展開方針・長文反復の見送りを実装。内容品質の比較待ち
4. 実音声・映像 同じキャラ・声の比較と、実測に基づく設定調整を記録する 実音声再生・初音声計測・評価保存を実装。対象キャラ・検証端末の指定待ち
5. 限定導入 検証済みの版を限定対象へ適用し、長時間動作と元設定への復帰を確認する 証拠照合ツールと設定復帰手順を追加。実測・Player配布・限定導入は未実施

自動テスト・架空シナリオの成功を、実モデルの意味理解、視聴者の評価、実配信の成功に読み替えない。後半段階には指定された対象と実環境の測定記録が必要。

訂正の参照先を残す

CharacterExperienceStateはv2の実配送完了時に、同一安定IDの直近3往復を10分間保持する。最大64人・192往復。語彙で訂正と判定できない「左の赤いほうです」も、その前の誤解と後の応答を含めて残る。既存の訂正候補は補助として維持する。

ConversationContinuityPolicy.ThreadContextは、本人の履歴公開許可・項目数・項目文字数・共有PII予算に従い、相手と自分の発言を組にして古い順に渡す。既存の明示的な訂正候補を優先し、その残りの件数・文字数で複数往復を補う。予算不足なら新しい往復を優先して組ごと省略する。v1、ゲスト、カンペ、自発発話へ個人別の往復を追加公開しない。人格/配信切替、短期会話消去、視聴者消去で破棄し、永続アーカイブへ書かない。

これは語彙に依存しない参照材料の保持であり、意味を自動確定する分類器ではない。対象・変更点・新しい話題への切替は、生成モデルが引用と現在入力を照合する。独立した推論APIや内部思考の保存は追加していない。

観客反応と反復の制御

共通方針に、元発話と反応の関連確認、関心→未説明の具体例、困惑→不足した前提、別意見→違いの紹介、短い笑い→過剰説明を避ける判断を追加した。初見向けの補足は主語や対象を見失う場面だけにする。モデルがどの展開を選べたかは比較ケースの内容評価で確認する。

任意の自発発話が、直近90秒の可聴完了した30文字以上の発話と、タグ・句読点・空白・表記正規化後に全文一致した場合はSkippedへする。短い相槌、部分配送、古い発話、通常応答、必須台本には適用しない。同義表現の反復まで自動検出したとは扱わない。

比較・診断・音声の接続

実行手順、暫定採用基準、対象外経路、証拠ファイルは評価手順を参照。モデル比較は本番プロンプト全体やコメント受付を通すE2Eではなく、状況整理・履歴・生成予算のコンポーネント比較である。

自動検証と未完了の境界

Unity 2022.3.15f1のコンパイルとEditMode回帰テストは323件成功・失敗0・スキップ0(2026-09-22 20:27 JST)。導入判定ツールのPythonテストは8件成功。暗黙の訂正を含む往復の保持、別人との分離、公開予算、失効、反復抑制、比較ケースの配線、設定scopeの復元、生成/音声計測、証拠不足時の不合格を確認した。10,000往復の有界性も検査した。自動検証記録

現行コードとケースの指紋を記録した導入候補を用いて、導入準備状態を生成した。結果はreadyForLimitedRollout=false、終了コード2(必要な証拠が未取得)。未指定の対象や未実施の評価を埋めて合格にしていない。

対象キャラ・端末・検証環境の指定を依頼済み。実LLM/TTSへの比較要求、録画の評価、1時間の連続配信、設定変更/復帰、Player配布、staging/本番への適用は未実施。これらが完了するまでは5段階全体を完了扱いにしない。