残り5段階の実装・検証記録
2026-09-22。8章の続きとして、比較評価、訂正の継続、観客反応による展開、実音声・映像での調整、限定導入を進める。
| 段階 | 完了条件 | 現在の状態 |
|---|---|---|
| 1. 比較評価 | 同じ入力・状況を反復し、生成結果と実効条件・待ち時間・見送りを比較できる | リプレイ・計測・比較画面を実装、自動検証済み。実モデル比較待ち |
| 2. 訂正 | 特定語彙に依存せず、同一相手の参照先と後続発話を照合できる | 複数往復の保持・公開と判断方針を実装。意味理解の実モデル評価待ち |
| 3. 観客反応と展開 | 関連する反応を根拠に続きと説明量を選び、反復・未取得反応の創作を避ける | 展開方針・長文反復の見送りを実装。内容品質の比較待ち |
| 4. 実音声・映像 | 同じキャラ・声の比較と、実測に基づく設定調整を記録する | 実音声再生・初音声計測・評価保存を実装。対象キャラ・検証端末の指定待ち |
| 5. 限定導入 | 検証済みの版を限定対象へ適用し、長時間動作と元設定への復帰を確認する | 証拠照合ツールと設定復帰手順を追加。実測・Player配布・限定導入は未実施 |
自動テスト・架空シナリオの成功を、実モデルの意味理解、視聴者の評価、実配信の成功に読み替えない。後半段階には指定された対象と実環境の測定記録が必要。
訂正の参照先を残す
CharacterExperienceStateはv2の実配送完了時に、同一安定IDの直近3往復を10分間保持する。最大64人・192往復。語彙で訂正と判定できない「左の赤いほうです」も、その前の誤解と後の応答を含めて残る。既存の訂正候補は補助として維持する。
ConversationContinuityPolicy.ThreadContextは、本人の履歴公開許可・項目数・項目文字数・共有PII予算に従い、相手と自分の発言を組にして古い順に渡す。既存の明示的な訂正候補を優先し、その残りの件数・文字数で複数往復を補う。予算不足なら新しい往復を優先して組ごと省略する。v1、ゲスト、カンペ、自発発話へ個人別の往復を追加公開しない。人格/配信切替、短期会話消去、視聴者消去で破棄し、永続アーカイブへ書かない。
これは語彙に依存しない参照材料の保持であり、意味を自動確定する分類器ではない。対象・変更点・新しい話題への切替は、生成モデルが引用と現在入力を照合する。独立した推論APIや内部思考の保存は追加していない。
観客反応と反復の制御
共通方針に、元発話と反応の関連確認、関心→未説明の具体例、困惑→不足した前提、別意見→違いの紹介、短い笑い→過剰説明を避ける判断を追加した。初見向けの補足は主語や対象を見失う場面だけにする。モデルがどの展開を選べたかは比較ケースの内容評価で確認する。
任意の自発発話が、直近90秒の可聴完了した30文字以上の発話と、タグ・句読点・空白・表記正規化後に全文一致した場合はSkippedへする。短い相槌、部分配送、古い発話、通常応答、必須台本には適用しない。同義表現の反復まで自動検出したとは扱わない。
比較・診断・音声の接続
ConversationRehearsalSession: 隔離した架空会話のリプレイ。実際の生成結果を次ターンの仮想履歴へ渡す。失敗・見送りは配送扱いにしない。ConversationRehearsalWindow: 16ケース・37ターンを3条件で比較し、手動評価、個別音声再生、結果JSON保存を提供する。設定は要求scopeに限定し、実配信の履歴・クラウド設定へ書き込まない。ConversationGenerationJournal: 生成結果・時間・予算・モデル/effortの計測。Snapshot IDで単一コメントの配送計測と対応できる。本文やviewer IDを保持せず、最大256件。ConversationDeliveryTiming: 単一コメントの処理開始/Trace時刻→初音声、TTS準備時間と実配送の結果。3種類のtracked TTSで、実際に観測した初音声だけを測る。完了receiptで補う開始通知は初音声にしない。scripts/conversation-quality/assess.py: 同一条件・現行ソースの比較結果、未評価、欠落した録画・長時間運転・設定復帰・Player成果物を検査する。合格でもデプロイは実行しない。
実行手順、暫定採用基準、対象外経路、証拠ファイルは評価手順を参照。モデル比較は本番プロンプト全体やコメント受付を通すE2Eではなく、状況整理・履歴・生成予算のコンポーネント比較である。
自動検証と未完了の境界
Unity 2022.3.15f1のコンパイルとEditMode回帰テストは323件成功・失敗0・スキップ0(2026-09-22 20:27 JST)。導入判定ツールのPythonテストは8件成功。暗黙の訂正を含む往復の保持、別人との分離、公開予算、失効、反復抑制、比較ケースの配線、設定scopeの復元、生成/音声計測、証拠不足時の不合格を確認した。10,000往復の有界性も検査した。自動検証記録。
現行コードとケースの指紋を記録した導入候補を用いて、導入準備状態を生成した。結果はreadyForLimitedRollout=false、終了コード2(必要な証拠が未取得)。未指定の対象や未実施の評価を埋めて合格にしていない。
対象キャラ・端末・検証環境の指定を依頼済み。実LLM/TTSへの比較要求、録画の評価、1時間の連続配信、設定変更/復帰、Player配布、staging/本番への適用は未実施。これらが完了するまでは5段階全体を完了扱いにしない。