Matched Files cross-model study18 rows The requester model varies while the responder remains GPT-5-mini. These 18 operating points cover Files QA only. |
|---|
| — | Files · GPT-5-mini · D0 reference runmatched · 2 reps400 attempts · 200 tasks × 2 reps | GPT-5-mini | GPT-5-mini | Single-step | Files QA · 200 | D0 · no policy | 78.0% | 17.0% | — | — |
| — | Files · GPT-5-mini · D1 reference runmatched · 2 reps400 attempts · 200 tasks × 2 reps | GPT-5-mini | GPT-5-mini | Single-step | Files QA · 200 | D1 · generic caution | 78.5% | 18.5% | — | — |
| — | Files · GPT-5-mini · D2 reference runmatched · 2 reps400 attempts · 200 tasks × 2 reps | GPT-5-mini | GPT-5-mini | Single-step | Files QA · 200 | D2 · category rules | 77.0% | 86.0% | — | — |
| — | Files · GPT-5.5 · D0 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.5 | GPT-5-mini | Single-step | Files QA · 200 | D0 · no policy | 87.0% | 12.0% | — | — |
| — | Files · GPT-5.5 · D1 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.5 | GPT-5-mini | Single-step | Files QA · 200 | D1 · generic caution | 94.0% | 25.0% | — | — |
| — | Files · GPT-5.5 · D2 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.5 | GPT-5-mini | Single-step | Files QA · 200 | D2 · category rules | 86.0% | 96.0% | — | — |
| — | Files · GPT-5.4-mini · D0 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.4-mini | GPT-5-mini | Single-step | Files QA · 200 | D0 · no policy | 96.0% | 13.0% | — | — |
| — | Files · GPT-5.4-mini · D1 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.4-mini | GPT-5-mini | Single-step | Files QA · 200 | D1 · generic caution | 99.0% | 10.0% | — | — |
| — | Files · GPT-5.4-mini · D2 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.4-mini | GPT-5-mini | Single-step | Files QA · 200 | D2 · category rules | 91.0% | 93.0% | — | — |
| — | Files · GPT-5.4 · D0 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.4 | GPT-5-mini | Single-step | Files QA · 200 | D0 · no policy | 98.0% | 8.0% | — | — |
| — | Files · GPT-5.4 · D1 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.4 | GPT-5-mini | Single-step | Files QA · 200 | D1 · generic caution | 97.0% | 20.0% | — | — |
| — | Files · GPT-5.4 · D2 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | GPT-5.4 | GPT-5-mini | Single-step | Files QA · 200 | D2 · category rules | 74.0% | 99.0% | — | — |
| — | Files · Kimi K2.6 · D0 reference runmatched · caveated200 attempts · 200 tasks × 1 rep Approximately 12% infrastructure errors; missing responses are not refusals. | Kimi K2.6 | GPT-5-mini | Single-step | Files QA · 200 | D0 · no policy | 82.0% | 7.0% | — | — |
| — | Files · Kimi K2.6 · D1 reference runmatched · caveated200 attempts · 200 tasks × 1 rep Approximately 12% infrastructure errors; missing responses are not refusals. | Kimi K2.6 | GPT-5-mini | Single-step | Files QA · 200 | D1 · generic caution | 86.0% | 13.0% | — | — |
| — | Files · Kimi K2.6 · D2 reference runmatched · caveated200 attempts · 200 tasks × 1 rep Approximately 12% infrastructure errors; missing responses are not refusals. | Kimi K2.6 | GPT-5-mini | Single-step | Files QA · 200 | D2 · category rules | 81.0% | 96.0% | — | — |
| — | Files · DeepSeek V3.2 · D0 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | DeepSeek V3.2 | GPT-5-mini | Single-step | Files QA · 200 | D0 · no policy | 91.0% | 7.0% | — | — |
| — | Files · DeepSeek V3.2 · D1 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | DeepSeek V3.2 | GPT-5-mini | Single-step | Files QA · 200 | D1 · generic caution | 97.0% | 20.0% | — | — |
| — | Files · DeepSeek V3.2 · D2 reference runmatched · 1 rep200 attempts · 200 tasks × 1 rep | DeepSeek V3.2 | GPT-5-mini | Single-step | Files QA · 200 | D2 · category rules | 62.0% | 91.0% | — | — |
Fixed-D2 relationship study4 rows One 600-task run per requester contract under the same D2 policy. Information labels change with the active relationship. |
|---|
| — | Fixed D2 · colleague reference runone run · requester600 attempts · 600 tasks × 1 run | Task prompts | GPT-5-mini | Single-step · relationship | All 600 · colleague | D2 · category rules | 54.3% | 98.3% | 92.0% | 90.0% |
| — | Fixed D2 · CEO delegate reference runone run · requester600 attempts · 600 tasks × 1 run | Task prompts | GPT-5-mini | Single-step · relationship | All 600 · CEO delegate | D2 · category rules | 45.0% | 96.7% | 89.0% | 85.0% |
| — | Fixed D2 · close friend reference runone run · requester600 attempts · 600 tasks × 1 run | Task prompts | GPT-5-mini | Single-step · relationship | All 600 · close friend | D2 · category rules | 52.7% | 90.8% | 92.0% | 84.0% |
| — | Fixed D2 · investor reference runone run · requester600 attempts · 600 tasks × 1 run | Task prompts | GPT-5-mini | Single-step · relationship | All 600 · investor | D2 · category rules | 68.1% | 92.5% | 83.0% | 91.0% |
Relationship policy and mounted access3 rows GPT-5.5 on the Files QA slice across five requester profiles. These rows compare semantic policy and pre-retrieval reachability. |
|---|
| — | Relationship policy reference runone run · profile1,000 attempts · 200 tasks × 5 profiles 31 judge or infrastructure errors. | Task prompts | GPT-5.5 | Single-step · relationship | Files QA · 5 profiles | Requester-specific policy | 78.9% | 87.1% | — | — |
| — | Mounted access reference runone run · profile1,000 attempts · 200 tasks × 5 profiles 30 judge or infrastructure errors; reachability and policy both differ. | Task prompts | GPT-5.5 | Single-step · relationship | Files QA · 5 profiles | Profile-scoped mount · no policy | 64.2% | 91.0% | — | — |
| — | Relationship policy + mount reference runone run · profile1,000 attempts · 200 tasks × 5 profiles 48 judge or infrastructure errors; same-policy mounting comparison. | Task prompts | GPT-5.5 | Single-step · relationship | Files QA · 5 profiles | Requester policy + scoped mount | 65.2% | 94.4% | — | — |