{
  "schema": "T_GPT_PLANNING_TASKS_V0_8_2",
  "date": "2026-09-11",
  "status": "PLANNING_ONLY_NEVER_CONFIRMATORY",
  "purpose": "Estimate between-task variance, mapping quality, support richness, probe/control behavior and family heterogeneity before confirmatory freeze.",
  "n_tasks": 20,
  "families": {
    "F1_POLYSEMY_UNDERSPECIFICATION": 4,
    "F2_CAUSAL_ALTERNATIVES": 4,
    "F3_DESIGN_UNDER_CONSTRAINTS": 4,
    "F4_STRUCTURAL_INTERPRETATION": 4,
    "F5_MULTI_SOLUTION_REASONING": 4
  },
  "global_rules": {
    "planning_tasks_never_reused_in_confirmation": true,
    "development_outputs_from_these_tasks_never_enter_confirmatory_effect_estimates": true,
    "minimum_condition_blinded_codebook_construction": true,
    "target_semantic_cluster_range": [6, 20],
    "exclude_if_ceiling_or_single_class": true,
    "exclude_if_cluster_assignment_alpha_below_gate_after_one_revision": true,
    "do_not_treat_reference_taxonomy_as_exhaustive_gold": true
  },
  "tasks": [
    {
      "id": "PLN_F1_01",
      "family": "F1_POLYSEMY_UNDERSPECIFICATION",
      "prompt": "Une équipe demande : « Prépare un plan de reprise pour lundi. » Aucun autre contexte n'est disponible. Donne les interprétations opérationnelles distinctes et raisonnables de « plan de reprise » qui changeraient réellement ce qu'il faudrait produire. N'invente pas des variantes purement stylistiques.",
      "adjudication_focus": "Distinct referents/usages of reprise that imply materially different deliverables.",
      "seed_categories_non_exhaustive": ["reprise après incident ou interruption", "reprise d'activité ou retour en service", "reprise/rachat d'une activité ou d'un actif", "reprise d'un projet ou chantier suspendu", "reprise d'un contenu/production à corriger ou continuer"],
      "relevance_rule": "A category is relevant only if it implies a substantively different plan object or decision path.",
      "anti_ceiling_note": "Seed list is not shown to evaluated models and is explicitly non-exhaustive."
    },
    {
      "id": "PLN_F1_02",
      "family": "F1_POLYSEMY_UNDERSPECIFICATION",
      "prompt": "On te demande simplement : « Fais une page de synthèse pour le projet. » Sans autre précision, quelles formes de « page de synthèse » sont légitimement possibles et changent la structure ou la fonction du résultat ? Regroupe les réponses par type de fonction, pas par style graphique.",
      "adjudication_focus": "Functional interpretations of synthesis page.",
      "seed_categories_non_exhaustive": ["résumé exécutif", "tableau de bord d'état", "carte de navigation/index", "synthèse analytique des résultats", "fiche de décision", "chronologie", "page de sources/provenance", "comparatif de scénarios"],
      "relevance_rule": "Different visual themes are not different semantic clusters unless function or information architecture changes."
    },
    {
      "id": "PLN_F1_03",
      "family": "F1_POLYSEMY_UNDERSPECIFICATION",
      "prompt": "Un message interne dit : « Il faut ouvrir le système avant vendredi. » Aucun domaine n'est précisé. Quelles interprétations distinctes de « ouvrir le système » seraient raisonnables dans un contexte de projet numérique ou organisationnel, et quelles actions différentes chacune impliquerait-elle ?",
      "adjudication_focus": "Different senses of opening a system that entail distinct operations.",
      "seed_categories_non_exhaustive": ["ouvrir l'accès aux utilisateurs", "ouvrir le code ou les interfaces", "ouvrir le système à des intégrations/API", "ouvrir une phase de test", "ouvrir les droits/permissions", "mettre en production/publique", "déverrouiller une configuration fermée", "ouvrir la gouvernance/contribution"],
      "relevance_rule": "Cluster must imply a distinct operational intervention, not a synonym."
    },
    {
      "id": "PLN_F1_04",
      "family": "F1_POLYSEMY_UNDERSPECIFICATION",
      "prompt": "Une consigne de conception dit : « Il faut une version légère. » Sans autre contexte, identifie les dimensions distinctes selon lesquelles « légère » peut être légitimement comprise pour un produit logiciel ou une interface. Ne confonds pas synonymes et dimensions différentes.",
      "adjudication_focus": "Independent dimensions of lightweight design.",
      "seed_categories_non_exhaustive": ["faible poids de téléchargement", "faible consommation mémoire/CPU", "faible latence", "interface visuellement épurée", "peu de fonctionnalités", "faible dépendance réseau", "faible complexité d'installation", "faible coût d'exploitation", "faible charge cognitive"],
      "relevance_rule": "Dimension must be operationally measurable or design-relevant."
    },
    {
      "id": "PLN_F2_01",
      "family": "F2_CAUSAL_ALTERNATIVES",
      "prompt": "Après une migration technique, le temps médian de chargement d'une application a augmenté de 40 %, alors que le trafic total et le volume de données semblent inchangés. Énumère des classes de mécanismes causaux distinctes et plausibles à tester avant de conclure. Ne donne pas plusieurs formulations du même mécanisme.",
      "adjudication_focus": "Mechanistically distinct causal hypotheses that are testable.",
      "seed_categories_non_exhaustive": ["régression code/client", "latence réseau/routage", "cache invalidé ou moins efficace", "base de données/indexation", "service tiers/API", "configuration infrastructure", "sérialisation/compression", "observabilité/instrumentation", "contention de ressources", "changement de géographie/CDN"],
      "relevance_rule": "Must explain increased latency under stated observations and imply a discriminating test."
    },
    {
      "id": "PLN_F2_02",
      "family": "F2_CAUSAL_ALTERNATIVES",
      "prompt": "Le taux de complétion d'un cours en ligne baisse fortement après une refonte, alors que le nombre d'inscriptions reste stable. Propose des classes d'explications causales distinctes qui pourraient produire ce profil, avec pour chacune un indicateur permettant de la distinguer des autres.",
      "adjudication_focus": "Distinct causal classes plus discriminating evidence.",
      "seed_categories_non_exhaustive": ["friction UX/navigation", "contenu plus difficile/long", "erreur technique", "notifications/rappels modifiés", "population d'inscrits différente malgré volume stable", "mesure/analytics cassée", "progression ou prérequis modifiés", "performance mobile", "motivation/incitations", "calendrier/rythme"],
      "relevance_rule": "Hypothesis must be compatible with stable enrollment and lower measured completion."
    },
    {
      "id": "PLN_F2_03",
      "family": "F2_CAUSAL_ALTERNATIVES",
      "prompt": "Un capteur environnemental affiche des valeurs systématiquement plus basses après une mise à jour de firmware, sans changement physique volontaire du lieu. Quelles familles d'explications distinctes faut-il envisager avant d'accuser le capteur lui-même ?",
      "adjudication_focus": "Distinct measurement-chain and environmental mechanisms.",
      "seed_categories_non_exhaustive": ["recalibration/offset logiciel", "conversion d'unités", "filtrage/lissage", "fréquence d'échantillonnage", "compensation température/humidité", "pipeline de transmission", "arrondi/quantification", "horodatage/fenêtre d'agrégation", "alimentation/échauffement", "changement indirect de position ou ventilation"],
      "relevance_rule": "Must be a distinct mechanism that can create a systematic downward shift."
    },
    {
      "id": "PLN_F2_04",
      "family": "F2_CAUSAL_ALTERNATIVES",
      "prompt": "Après un changement d'emballage mais sans modification volontaire de la formule du produit, les plaintes clients augmentent. Donne des mécanismes causaux distincts qui restent compatibles avec cette information et propose un test discriminant pour chacun.",
      "adjudication_focus": "Causal alternatives spanning product, logistics, expectation and measurement.",
      "seed_categories_non_exhaustive": ["protection physique différente", "étanchéité/oxydation", "dosage ou ouverture modifiée", "stockage/transport", "effet d'attente/perception", "confusion de référence", "lot/fournisseur concomitant", "canal de plainte rendu plus visible", "erreur d'étiquetage", "interaction emballage-produit"],
      "relevance_rule": "Mechanism must not contradict the no-intentional-formula-change statement."
    },
    {
      "id": "PLN_F3_01",
      "family": "F3_DESIGN_UNDER_CONSTRAINTS",
      "prompt": "Conçois plusieurs architectures réellement distinctes pour un système de notifications qui doit fonctionner avec connexion intermittente, ne rien pousser entre 22 h et 7 h, permettre un contrôle utilisateur fin et ne pas dépendre d'un profil publicitaire centralisé. Chaque architecture doit satisfaire toutes les contraintes.",
      "adjudication_focus": "Distinct system architectures satisfying common constraints.",
      "seed_categories_non_exhaustive": ["queue locale puis synchronisation", "broker serveur avec fenêtres de livraison", "polling client adaptatif", "push chiffré avec règles locales", "store-and-forward fédéré", "digest périodique", "event sourcing avec préférences côté client"],
      "relevance_rule": "Architecture must differ in control/data-flow, not only technology names, and satisfy all constraints."
    },
    {
      "id": "PLN_F3_02",
      "family": "F3_DESIGN_UNDER_CONSTRAINTS",
      "prompt": "Propose plusieurs structures de navigation distinctes pour un corpus de recherche web comprenant environ 40 pages. Contraintes : utilisable sur mobile, lisible sans JavaScript, accès rapide aux sources et aux versions historiques, et aucune navigation ne doit exiger de connaître la structure interne du dépôt.",
      "adjudication_focus": "Information architectures, not visual skins.",
      "seed_categories_non_exhaustive": ["hub thématique", "navigation par parcours de recherche", "index facetté", "chronologie/versioning", "graphe relationnel avec fallback textuel", "table des matières hiérarchique", "recherche + index alphabétique", "double entrée humain/machine"],
      "relevance_rule": "Must satisfy no-JS core access and expose sources/history efficiently."
    },
    {
      "id": "PLN_F3_03",
      "family": "F3_DESIGN_UNDER_CONSTRAINTS",
      "prompt": "Imagine plusieurs protocoles distincts pour comparer deux méthodes d'agrégation de réponses LLM avec un budget de tokens identique, des sorties de longueur comparable, des annotateurs aveugles et une mesure de couverture plus un contrôle de faux positifs. Les protocoles doivent être expérimentalement réalisables.",
      "adjudication_focus": "Different experimental designs satisfying matched-budget/blinding/coverage constraints.",
      "seed_categories_non_exhaustive": ["within-pool paired", "cross-over sur tâches", "split-pool répété", "randomized block par tâche", "Latin-square d'ordre des agrégateurs", "nested task-model design", "holdout distractor design"],
      "relevance_rule": "Protocol must preserve a fair comparison and define a unit of inference."
    },
    {
      "id": "PLN_F3_04",
      "family": "F3_DESIGN_UNDER_CONSTRAINTS",
      "prompt": "Une petite équipe veut archiver un projet vivant pendant cinq ans. Contraintes : fichiers lisibles sans logiciel propriétaire, historique vérifiable, restauration d'un état antérieur, coût d'exploitation faible, et possibilité de publier une partie seulement. Propose plusieurs architectures d'archivage réellement distinctes.",
      "adjudication_focus": "Distinct archival architectures and trust models.",
      "seed_categories_non_exhaustive": ["Git + artefacts statiques", "snapshots signés + stockage objet", "WARC/BagIt périodique", "dépôt documentaire + manifest hashes", "double stockage local/cloud avec checksums", "archive append-only", "publication dérivée depuis master privé"],
      "relevance_rule": "Must satisfy long-term readability, verifiability and selective publication."
    },
    {
      "id": "PLN_F4_01",
      "family": "F4_STRUCTURAL_INTERPRETATION",
      "prompt": "Analyse les lectures structurelles plausibles de la spécification suivante : « Mettre en cache les réponses valides pendant dix minutes après la première requête réussie, sauf si le client demande explicitement une actualisation. » Identifie les ambiguïtés qui changeraient une implémentation correcte.",
      "adjudication_focus": "Implementation-relevant semantic ambiguities.",
      "seed_categories_non_exhaustive": ["cache par client ou global", "validité HTTP vs validité métier", "TTL depuis première réussite ou dernière écriture", "actualisation invalide ou contourne le cache", "clé de cache et paramètres", "échec après succès", "concurrence première requête", "actualisation remplace ou non l'entrée"],
      "relevance_rule": "Ambiguity must lead to distinct observable behavior."
    },
    {
      "id": "PLN_F4_02",
      "family": "F4_STRUCTURAL_INTERPRETATION",
      "prompt": "Une procédure dit : « Les documents récents validés par le responsable et archivés après contrôle sont publiés chaque semaine. » Donne les analyses syntaxiques ou procédurales distinctes qui changent quels documents sont publiés ou dans quel ordre les opérations ont lieu.",
      "adjudication_focus": "Scope/attachment/order ambiguities.",
      "seed_categories_non_exhaustive": ["récent modifie documents seulement", "validé et archivé comme deux conditions", "après contrôle porte sur archivage ou publication", "responsable valide avant/après contrôle", "publication hebdomadaire des seuls archivés", "contrôle comme événement global ou par document"],
      "relevance_rule": "Reading must change eligibility or sequence, not just wording."
    },
    {
      "id": "PLN_F4_03",
      "family": "F4_STRUCTURAL_INTERPRETATION",
      "prompt": "Un cahier des charges indique : « L'administrateur peut révoquer les accès temporaires des partenaires inactifs depuis 30 jours. » Quelles interprétations distinctes des portées et conditions sont plausibles, et quelles questions faut-il trancher avant implémentation ?",
      "adjudication_focus": "Scope of temporary, partner, inactive, 30 days, and permission vs obligation.",
      "seed_categories_non_exhaustive": ["inactivité du partenaire ou de l'accès", "30 jours depuis dernière connexion ou dernière activité", "tous les accès du partenaire ou seulement temporaires", "peut = permission discrétionnaire ou règle automatique", "statut partenaire au moment de la révocation", "renouvellement réinitialise le compteur", "activité sur un accès maintient les autres"],
      "relevance_rule": "Interpretation must alter authorization logic."
    },
    {
      "id": "PLN_F4_04",
      "family": "F4_STRUCTURAL_INTERPRETATION",
      "prompt": "Interprète structurellement cette consigne : « Comparer les modèles rapides et précis qui ont été mis à jour en 2026 avec les versions précédentes. » Quelles lectures différentes déterminent quels modèles entrent dans la comparaison et ce que signifie « versions précédentes » ?",
      "adjudication_focus": "Coordination, modifier scope and comparison-baseline ambiguity.",
      "seed_categories_non_exhaustive": ["rapides ET précis", "rapides OU précis", "mis à jour modifie tous les modèles ou seulement précis", "version immédiatement précédente", "toutes les versions antérieures", "version de début 2026 vs dernière pré-2026", "comparaison intra-modèle vs entre familles"],
      "relevance_rule": "Reading must alter inclusion set or baseline."
    },
    {
      "id": "PLN_F5_01",
      "family": "F5_MULTI_SOLUTION_REASONING",
      "prompt": "On dispose de quatre modules A, B, C, D. Il faut choisir au moins deux modules, inclure A ou B (au moins l'un des deux), ne jamais combiner C et D, et si A est choisi alors C doit aussi l'être. Donne des configurations valides réellement distinctes et explique une méthode de recherche qui ne suppose pas qu'il n'existe qu'une seule bonne solution.",
      "adjudication_focus": "Distinct satisfying assignments plus solution-enumeration strategy.",
      "seed_categories_non_exhaustive": ["B+C", "B+D", "A+C", "A+B+C"],
      "relevance_rule": "Configuration must satisfy all constraints; method must allow multiple solutions."
    },
    {
      "id": "PLN_F5_02",
      "family": "F5_MULTI_SOLUTION_REASONING",
      "prompt": "Un service doit réduire de 20 % son temps de traitement moyen sans embaucher et sans diminuer les contrôles qualité. Propose plusieurs stratégies opérationnelles distinctes, chacune avec une chaîne causale plausible et un indicateur qui permettrait de tester si elle fonctionne.",
      "adjudication_focus": "Distinct intervention mechanisms under fixed constraints.",
      "seed_categories_non_exhaustive": ["réduire files d'attente", "paralléliser étapes indépendantes", "supprimer reprises/rework", "automatiser tâches répétitives", "triage/priorisation", "réduire handoffs", "pré-validation", "batching adapté", "outillage/latence système"],
      "relevance_rule": "Strategy must preserve quality controls and not rely on added headcount."
    },
    {
      "id": "PLN_F5_03",
      "family": "F5_MULTI_SOLUTION_REASONING",
      "prompt": "Une équipe doit sélectionner un sous-ensemble de propositions pour une synthèse de 300 mots. Chaque proposition couvre une ou plusieurs catégories, certaines sont redondantes, et aucune catégorie importante ne doit disparaître. Décris plusieurs stratégies de sélection distinctes et les cas où chacune serait préférable.",
      "adjudication_focus": "Different selection algorithms/decision principles.",
      "seed_categories_non_exhaustive": ["greedy couverture/coût", "optimisation exacte sous contrainte", "DPP/diversité", "clustering puis représentant", "max-min couverture", "stratification par catégories", "sélection avec provenance/quotas", "compression progressive"],
      "relevance_rule": "Strategy must explicitly manage coverage under a hard length budget."
    },
    {
      "id": "PLN_F5_04",
      "family": "F5_MULTI_SOLUTION_REASONING",
      "prompt": "On veut tester si une conclusion dépend trop d'un seul chemin de raisonnement. Propose plusieurs designs expérimentaux distincts pour mesurer cette dépendance sans supposer que davantage de chemins est automatiquement meilleur.",
      "adjudication_focus": "Distinct experimental strategies for path-dependence.",
      "seed_categories_non_exhaustive": ["multi-sampling independent", "perturbation contrôlée", "contre-factuels de premiers tokens", "branch-and-merge", "ablation de contexte", "replay avec seeds", "cross-model replication", "path clustering + outcome stability"],
      "relevance_rule": "Design must quantify dependence/stability and include a quality or correctness guardrail."
    }
  ]
}
