Il motore dietro le risposte AI

Il migliore dei
modelli, senza
scegliere il modello.

Il tuo software continua a funzionare esattamente come prima. Dietro, MLR Core — un motore Multi Layered Reasoning, cioè a più strati — fa lavorare insieme più modelli di intelligenza artificiale: sceglie da solo quello più adatto, lo fa migliorare e ti restituisce la risposta migliore. Non devi scegliere il modello, non devi gestire le chiavi, non devi aggiornare nulla.


Il problema

Ogni integrazione con un modello AI porta con sé un peso operativo.

Ogni volta che esce un modello migliore ricominci: nuovi endpoint, nuove chiavi, nuovi limiti di frequenza da coordinare, nuove strategie di fallback da testare. Il costo di gestione cresce più in fretta della capacità che aggiungi.

01

Senza MLR Core

Ogni modello diverso significa un'integrazione diversa, credenziali diverse da distribuire, regole di fallback diverse da manutenere. E quando una quota finisce, la tua applicazione lo scopre a runtime.

02

Con un router trasparente

Selezione round-robin pura, senza alcun criterio: il contenuto della richiesta, il costo sostenuto, la latenza e la continuità della conversazione non entrano in decisione. Al primo errore si passa alla chiave successiva, senza sapere se risponderà meglio.

03

Con MLR Core

Il modello che chiama la tua app non cambia mai: resta un alias. Selezione, quota, qualità e degrado restano al motore, e il tuo codice non se ne accorge.

Multi Layered Reasoning

Non quattro strati. Quattro famiglie di strati.

"Multi Layered Reasoning" non significa un paio di passaggi: significa che ogni richiesta attraversa un insieme di strati, raggruppati qui in quattro famiglie. Ciascuno può migliorare la risposta, instradarla meglio, riutilizzare ciò che è già stato calcolato o proteggerla. Tutto accade senza che il tuo software se ne accorga.

Ragionamento

Il cuore del motore: decide quanto ragionare e come, poi migliora il risultato.

  • Profondità variabile — il registro di pensiero viene scelto da un punteggio di rischio: riflesso, giudizio o deliberazione.
  • CBR — Content-Based Routing — legge la richiesta, ne coglie la natura e sceglie il modello che la serve meglio.
  • ESD — Endogenous Self-Distillation — una prima stesura, un'autocritica contro fatti e regole, e la riscrittura finale.
  • Qualità ESD — il risultato del confronto viene valutato prima di sostituire la risposta originale.

Memoria e riuso

Non tutto ciò che è già stato calcolato va rifatto.

  • Cache semantica — confronta la domanda con quelle precedenti per similarità e restituisce la risposta già calcolata.
  • Cache di risposta — le richieste identiche non richiedono un secondo passaggio a pagamento.
  • Knowledge Base — documenti caricati e recupero arricchito, con embedding multilingue.
  • Memoria — il contesto che conta viene mantenuto oltre la singola richiesta.

Controllo del traffico

Ogni uscita verso l'esterno passa da qui: chi è ammesso, quanto può spendere, quanto è ancora disponibile.

  • Selettore intelligente — distribuisce il carico pesando le chiavi e saltando quelle già sature o degradate.
  • Quote a finestra — controllo del consumo a rotazione, per non esaurire il credito a metà giornata.
  • Degrado progressivo — un fornitore che inizia a fallire esce di rotazione da solo e rientra quando si è ripreso.
  • RATIO — tetto di spesa per dominio ed escalation automatica quando il bilancio va deviato.

Governance

Cosa è successo resta tracciato, e restano applicabili i diritti di chi ha parlato col sistema.

  • Registro a catena di hash — ogni evento è legato al precedente con un'impronta SHA-256: la cronologia non si può riscrivere.
  • Retention — conservazione dei log per 180 giorni, poi archiviazione o rimozione.
  • GDPR — export dei dati, portabilità e diritto all'oblio, ogni azione firmata e registrata.
  • Permessi firmati — ciò che ogni tenant può usare è dichiarato in una whitelist firmata e verificata a ogni chiamata.

Come sono collegati

Dalla tua app al modello: quattro passaggi, un solo punto d'ingresso.

Il traffico attraversa una catena corta e leggibile. Ogni anello ha un compito preciso e ognuno parla solo con il successivo: nessuno deve conoscere l'esistenza degli altri. È questa separazione che rende il motore Multi Layered — e che ti permette di cambiare il modello in fondo senza toccare nulla di ciò che sta sopra.

Le tue appscript · agenti · client
Hostcifratura · rate limit
MLR Coremulti layered reasoning
Modelli AIquelli che rispondono
Richiesta in arrivo Risposta in ritorno Fornitore sano e disponibile Quota vicina al limite

Orchestrazione

Il percorso di una richiesta.

Dall'ingresso alla risposta, senza che il client debba saperne nulla.

01 · Ingresso

Autenticazione

Chiave tenant. Rate limit applicati per chiave prima di fare qualsiasi lavoro.

02 · Selezione

CBR + strategia smart

Il contenuto decide la categoria; la strategia smart bilancia peso, quota, salute e continuità di conversazione.

03 · Esecuzione

Chiamata al modello

Streaming nativo senza buffer, con retry su errore e failover automatico su un altro modello.

04 · Qualità

ESD

Passata di revisione sulla bozza: viene restituito il risultato migliore.

05 · Ritorno

Risposta pulita

Risposta nel formato che ti aspetti: il tuo client non deve cambiare una riga.

Come instrada

Non serve conoscere i nomi

Basta la natura della richiesta. Ogni classe di lavoro trova da sé chi la svolge meglio, con quota monitorata e rotazione automatica.

Ragionamento
pensiero esteso
Richieste che vanno ragionate passo dopo passo
Volume
velocità e capacità
Molte richieste brevi, risposta immediata
Contesto lungo
analisi estesa
Documenti lunghi, ragionamento prolungato
Codice
sviluppo software
Compilazione, correzione, task prolungati
L'endpoint

Una sola configurazione, compatibile con quello che già usi.

Parli l'API che i tuoi client già parlano. Dietro, MLR Core fa il resto.

POST /v1/messages
# La tua app non cambia quasi nulla.
# Cambia la base URL, il resto è lo stesso.

{
  "model": "MLR-3",
  "max_tokens": 32768,
  "stream": true,
  "messages": [
    { "role": "user", "content": "..." }
  ]
}
  • Streaming SSE nativo: i token arrivano quando vengono, senza buffer.
  • Tool use nativo, con il ciclo di esecuzione gestito end-to-end.
  • Reasoning esteso: il ragionamento interno viene riscritto in un formato uniforme, qualunque sia il modello che lo ha prodotto.
  • Si collega a quello che stai già usando: Claude Code, pi, ZCode, opencode, MiniMax Code e ogni altro agente che parli il protocollo standard. Cambi l'indirizzo del servizio, non il tuo modo di lavorare.
  • Le risposte non portano con sé il nome di chi le ha prodotte: l'agente riceve un alias, non un fornitore.
  • Cache semantica attiva di default: le domande simili non pagano due volte.
  • Multimodale: testo e immagini, con contesto fino a un milione di token.
curl · verifica in 3 secondi
curl -s https://api.mlr-lab.com/v1/messages \
  -H "x-api-key: $MLR_KEY" \
  -H "content-type: application/json" \
  -d '{"model":"MLR-3","max_tokens":128,
     "messages":[{"role":"user",
       "content":"ping"}]}'

Future-proof

Non ti preoccupi mai di cosa sta dietro.

Il motore aggancia da solo le ultime tecnologie e gli ultimi modelli, e li rende disponibili con un nome stabile. Quando arriva qualcosa di nuovo, non è un progetto da fare: non devi fare nulla, ci pensa il sistema.

ZERO CONFIGURAZIONE

Niente da scegliere

Nessun SDK, nessun client da aggiornare, nessuna chiave da distribuire per modello. Il tuo codice conosce un nome, non un catalogo di fornitori.

AGGIORNAMENTO CONTINUO

Scoperta automatica

I modelli disponibili vengono rilevati e catalogati da soli. Quelli nuovi entrano nel pool senza aspettare un rilascio da parte tua.

ASTRAZIONE

Il nome non cambia

Dietro un alias come MLR-3 il motore può cambiare modello e strategia. Il tuo codice vede sempre la stessa stringa, e continua a funzionare.

Domande

Le domande che fanno tutti, prima di cominciare.

Se la tua non è qui, scrivi. Rispondiamo a chiunque lo chieda, anche prima di diventare un cliente.

Cos'è MLR Core, in una riga?

Un motore di Multi Layered Reasoning: fa lavorare insieme più modelli di intelligenza artificiale, sceglie da solo il più adatto e ti restituisce la risposta migliore. Tu continui a chiamare un nome solo.

Devo scegliere io il modello?

No. Il tuo codice conosce un nome stabile, non un catalogo. Dietro quel nome il motore può cambiare modello e strategia quando vuole, e il tuo codice continua a funzionare senza modifiche.

L'agente sa quale modello sta usando?

No, e questa è una garanzia, non un limite. L'agente riceve un alias, non un fornitore: non può dedurre quale modello sia dietro, né costruirsi una dipendenza da qualcosa che il motore può cambiare in qualsiasi momento.

Che devo fare per collegarmi?

Una chiave e un indirizzo. Non serve un SDK da installare, non serve un client da aggiornare, non serve una chiave da distribuire per ogni modello. La configurazione del tuo agente cambia una volta sola.

Dove finiscono i miei dati?

Sono descritti per esteso, e senza formule generiche, nelle nostre informative sulla privacy e nella cookie policy: tempi di conservazione per categoria, titolarità, hosting e basi giuridiche.

Come inizio?

Scrivici a info@mlr-lab.com e descrivi il tuo caso. Partiamo da un assessment: capiamo se il motore risolve il tuo problema prima di parlare di prezzi.

Pronto

Smetti di gestire i modelli.
Inizia a usarli.

Ti serve una chiave e un indirizzo. Il resto lo fa MLR Core — e continuerà a farlo anche quando il panorama dei modelli cambierà di nuovo.

Prenota un assessment info@mlr-lab.com