Skip to content

Sintesi di Software tramite Rappresentazioni Intermedie Ipergrafiche in Formato NDJSON-LD: Formalizzazione di un Framework di Generazione Vincolata per Modelli Linguistici Autoregressivi

Aug 2026 · Zenodo (CERN European Organization for Nuclear Research)
Software Engineering Research

Abstract

Sintesi di Software tramite Rappresentazioni Intermedie Ipergrafiche in Formato NDJSON-LD: Formalizzazione di un Framework di Generazione Vincolata per Modelli Linguistici Autoregressivi Autore: Luigi Usai Affiliazione / Località: Quartucciu (CA), Italia Data: 29 Agosto 2026 ORCID: https://orcid.org/0009-0003-3001-717X Identificatore di Categoria (Zenodo/ACM): Computer Science – Software Engineering (cs.SE); Artificial Intelligence (cs.AI); Formal Languages (cs.FL). Abstract La generazione di software strutturato e monolitico tramite modelli linguistici di grandi dimensioni (LLM) presenta storicamente tassi elevati di allucinazione dell'interfaccia, violazioni di invarianti logici e divergenza sintattica nei contesti zero-shot non vincolati. Questo lavoro formalizza una metodologia di sintesi single-prompt a due stadi basata sull'induzione preventiva di un ipergrafo matematico $H=(V,E)$ serializzato nello standard NDJSON-LD (Newline Delimited JSON for Linked Data). Attraverso la scomposizione delle dipendenze $n$-arie tra tipi, funzioni, invarianti e canali di I/O prima dell'emissione del codice target (Python), il modello riduce drasticamente l'entropia condizionale nello spazio di decodifica autoregressiva. Il formalismo proposto converte il task da un problema di generazione a sintassi libera a una proiezione isomorfa guidata da uno schema topologico. Vengono presentati il framework matematico, la specifica della grammatica NDJSON-LD, l'architettura della pipeline di inferenza e il protocollo sperimentale di falsificazione empirica. Parole chiave: Program Synthesis, Neurosymbolic AI, Hypergraph Theory, NDJSON-LD, Prompt Engineering, Large Language Models, AST Generation, Code Reliability. 1. Introduzione e Definizione del Problema Nei modelli autoregressivi basati sull'architettura Transformer, la probabilità di emissione di una sequenza di codice sorgente $C = (c_1, c_2, \dots, c_T)$ a partire da una specifica informale in linguaggio naturale $P$ è descritta dal prodotto: $$P(C \mid P) = \prod_{t=1}^T P(c_t \mid c_{ [ V_func: PureTransformer ] | | │ | | ▼ | | [ V_inv: BoundaryCheck ] <-- [ V_type: ValidatedOutput ] | +-------------------------------------------------------------+ 3. Specificazione della Sintassi NDJSON-LD La scelta dello standard NDJSON-LD (Newline Delimited JSON-LD) garantisce tre proprietà computazionali ottimali per gli LLM: Streaming line-by-line deterministico: Ogni riga costituisce un'asserzione topologica autosufficiente, minimizzando la complessità dell'albero sintattico durante il parsing. Semantica formale esplicita (@context, @id, @type): Riduzione dell'ambiguità polisemica dei token. Compressione del footprint di contesto: Eliminazione dell'indentazione ricorsiva del JSON standard, massimizzando il throughput della context window. Schema formale di un record NDJSON-LD JSON Data format: RDF-Turtle JSON-LD JSON CSV RDF/XML Markdown RSS Atom {"@context": "https://schema.org/SoftwareSourceCode", "@id": "node:State", "@type": "TypeNode", "signature": "typing.NamedTuple", "properties": {"id": "UUID", "payload": "bytes"}} {"@context": "https://schema.org/SoftwareSourceCode", "@id": "node:Inv1", "@type": "InvariantNode", "predicate": "len(payload) <= 4096"} {"@context": "https://schema.org/SoftwareSourceCode", "@id": "edge:Transform", "@type": "HyperEdge", "sources": ["node:State"], "targets": ["node:Result"], "guards": ["node:Inv1"], "complexity": "O(N)"} 4. Architettura della Pipeline di Sintesi La pipeline di generazione si struttura su un processo deterministico a fasi sequenziali all'interno della medesima sessione di campionamento: Data format: RDF-Turtle JSON-LD JSON CSV RDF/XML Markdown RSS Atom +-------------------------------------------------------------------------+ | Prompt di Vincolo Epistemico + Requisiti Funzionali | +-------------------------------------------------------------------------+ │ ▼ +-------------------------------------------------------------------------+ | Generazione dell'Ipergrafo $H$ in NDJSON-LD | | (Allocazione di token per pianificazione topologica e contrattuale) | +-------------------------------------------------------------------------+ │ ▼ +-------------------------------------------------------------------------+ | Ordinamento Topologico degli Iperarchi | | (Risoluzione delle dipendenze $n$-arie dei nodi sorgente) | +-------------------------------------------------------------------------+ │ ▼ +-------------------------------------------------------------------------+ | Emissione del Codice Python Target | | (Implementazione di protocolli, tipi algebrici, contratti e runtime) | +-------------------------------------------------------------------------+ Regole di Traslazione $H \to \text{Python}$ Ogni $v \in V_{\text{type}}$ viene traslato in classi immutabili @dataclass(frozen=True) o typing.Protocol. Ogni $v \in V_{\text{inv}}$ viene mappato in asserzioni di runtime esplicite o clausole contrattuali (icontract / clausole di guardia). Ogni $e \in E$ viene compilato come funzione pura tipizzata staticamente con annotazioni rigorose (mypy --strict). 5. Analisi Comparativa Parametro di Valutazione Zero-Shot Diretto (P→C) Chain-of-Thought (CoT) Program Dependence Graph (PDG) NDJSON-LD Hypergraph (P→H→C) Modellazione Relazionale Implicita / Sequenziale Sequenziale informale Grafi binari ($\vert{}e\vert{}=2$) Ipergrafi $n$-ari ($\vert{}e\vert{} \ge 2$) Overhead di Parsing Assente Variabile (testo libero) Elevato (XML/DOT) Basso (NDJSON streaming) Preservazione Invarianti Bassa (Decadimento $t > 10^3$) Media Buona (strutturale) Elevata (vincolo esplicito) Allucinazione dei Tipi Elevata Media Bassa Minima (topologia chiusa) 6. Limiti Epistemologici e Protocollo di Falsificazione Per conferire al metodo validità scientifica, sono stabiliti i seguenti criteri di falsificabilità e limitazioni: Limiti intrinseci Complessità degli Iper-cicli: La presenza di dipendenze cicliche tra iperarchi $n$-ari non risolvibili genera blocchi logici che richiedono algoritmi di condensazione topologica a monte della compilazione. Consumo di Output Budget: La generazione dell'ipergrafo NDJSON-LD consuma tra il $20\%$ e il $40\%$ della finestra di generazione massima, limitando la dimensione netta del codice sintetizzabile in singolo turno. Protocollo Sperimentale di Validazione (Ablation Study) Il framework deve essere validato tramite un benchmark quantitativo strutturato come segue: Dataset di Test: SWE-bench Verified (500

View source

Similar papers

Related blog posts