Hai ChatGPT Plus sulla card e un collega che spinge Claude. Nessuno ha misurato su quale lavoro conviene quale tool. Questo pezzo e un Test Lab: tre workflow tipici di PMI, stesso setup, metriche semplici, decisione praticabile lunedi mattina.

Non è una recensione da influencer. È un protocollo che puoi ripetere in azienda, allineato ai costi e alla governance gia trattati in AI per PMI: costi reali, policy ChatGPT in 1 pagina e checklist AI Act.

In 30 secondi

  • Obiettivo: scegliere dove mettere i seat (o se serviranno entrambi), non incoronare un modello.
  • Tre prove: (1) triage e bozza risposta email, (2) riassunto di un pacchetto documenti, (3) bozza commerciale da brief CRM.
  • Metriche: minuti umani, numero di revisioni prima di inviare, errori o inventati, e se i dati potevano restare fuori dal prompt.
  • Prezzi Team/Business: su Anthropic il seat Team standard e indicato a 20 USD/mese se fatturato annualmente (25 USD mensile) sulla pagina pricing Claude. Per ChatGPT Business verifica sempre la pagina pricing OpenAI (i listini cambiano e i piani Business partono tipicamente da piu utenti).
  • Per te: un foglio con 5 prove per workflow, owner, e regola dati (niente clienti/PII nel piano personale).

Ipotesi del Test Lab

Ipotesi A: Claude rende meglio su documenti lunghi e bozze formali italiane (tono, struttura, meno "marketing fluff").

Ipotesi B: ChatGPT rende meglio quando il compito richiede ricerca web fresca, allegati misti, o integrazione con stack Microsoft/Slack.

Ipotesi C: Per una PMI sotto i 20 seat, un solo tool copre l'80% dei casi; il secondo seat si giustifica solo se un workflow critico resta sistematicamente peggiore.

Queste ipotesi vanno falsificate con le tue prove, non con un screenshot di classifica su X.

Setup PMI (ripetibile in 90 minuti)

1. Account: preferisci piani Team/Business (dati esclusi dal training di default dove previsto dal piano). Evita di collaudare con account free personali e prompt pieni di clienti reali.

2. Materiale anonimizzato: email inventate ma realistiche; PDF/contratti con nomi finti; brief commerciale senza partita IVA vera.

3. Prompt base uguale sui due tool (sotto). Solo dopo puoi aggiungere "system" o project knowledge specifici.

4. Cronometro umano: dal "incolla input" al "pronto da rivedere", non il tempo modello dichiarato dal vendor.

5. Rubrica qualità (0-2 per voce): completezza, tono adatto al cliente IT, assenza di inventati, istruzioni operative chiare, rischio dati gestito.

Se stai ancora scegliendo *cosa* automatizzare prima del tool, parti da primo processo da automatizzare.

Workflow 1: triage email e bozza risposta

Compito: da un thread di 6-10 messaggi (preventivo, reclamo leggero, o richiesta documenti), produrre: (a) riassunto in 5 bullet, (b) priorita, (c) bozza risposta in italiano formale, (d) 3 punti da verificare con un umano prima di inviare.

Prompt base (copia-incolla):

```

Sei assistente di ufficio in una PMI italiana.

Da questo thread email: 1) riassumi in max 5 bullet, 2) assegna priorita alta/media/bassa con motivo, 3) bozza risposta cortese e concreta (max 180 parole), 4) elenca 3 controlli umani obbligatori prima dell'invio.

Non inventare date, importi o impegni assenti nel thread.

```

Cosa osservare

| Criterio | Cosa segnare |

|---|---|

| Tempo | minuti fino a bozza utilizzabile |

| Revisioni | quante modifiche prima dell'invio |

| Inventati | date/importi/impegni non presenti |

| Tono | troppo servile, troppo secco, o ok B2B IT |

| Dati | hai dovuto incollare allegati sensibili? |

Esito tipico da laboratorio (non verdetto universale): Claude spesso tiene meglio il filo del thread e le "cose da non promettere". ChatGPT recupera quando nel thread citi link esterni da controllare o chiedi una bozza piu "marketing". Per privacy email, collega anche vendor: 10 domande in contratto.

Tenere / scartare

  • Tieni il tool che riduce le revisioni sotto 2 e non inventa impegni.
  • Scarta l'uso in piano personale se le email contengono dati clienti: passa a workspace aziendale e policy scritta.

Workflow 2: riassunto pacchetto documenti

Compito: 2-4 file (offerta fornitore + capitolato corto, o contratto + appendice). Output: sintesi esecutiva per titolare (1 pagina), rischi/clausole da far vedere al consulente, checklist "cosa manca".

Prompt base:

```

Sei analista interno in una PMI.

Dai documenti seguenti produci: 1) sintesi esecutiva max 250 parole, 2) 5 rischi o clausole da far leggere a legale/commercialista, 3) checklist di informazioni mancanti, 4) cosa NON e nel testo (non inventare).

Scrivi in italiano chiaro, niente retorica.

```

Cosa osservare: tenuta del contesto su documenti lunghi, citazioni fedeli vs parafrasi fantasiose, utilita della checklist.

Esito tipico: su pacchetti lunghi Claude spesso resta piu fedele al testo; ChatGPT e piu comodo se dopo la sintesi vuoi subito una tabella o uno schema da esportare. In entrambi i casi: non e parere legale. Se usi agenti con accesso a cartelle, applica i controlli di audit permessi agente in 30 minuti.

Tenere / scartare

  • Tieni il tool che segnala esplicitamente i vuoti ("non presente nel testo").
  • Scarta il riassunto "ottimistico" che inventa garanzie o SLA.

Workflow 3: bozza commerciale da brief CRM

Compito: da 8-12 righe di brief (settore cliente, dolore, budget indicativo, prossimo step), produrre email di follow-up + outline proposta 1 pagina.

Prompt base:

```

Sei sales ops in una PMI B2B italiana.

Dal brief: 1) email di follow-up (oggetto + corpo max 160 parole), 2) outline proposta in 6 sezioni, 3) 3 obiezioni probabili con risposte oneste, 4) cosa deve confermare un umano (prezzo, tempi, scope).

Non inventare case study o certificazioni.

```

Cosa osservare: realismo commerciale italiano (niente hype USA), chiarezza su next step, tentazione di inventare social proof.

Esito tipico: Claude spesso produce bozze piu sobrie; ChatGPT a volte propone varianti creative utili in brainstorm, meno utili se inviate grezze. Per agenti che toccano CRM, rivedi anche GPT-6 Astra e cosa conta per le PMI.

Tenere / scartare

  • Tieni il tool che forza i "conferma umana" su prezzo e scope.
  • Scarta bozze con case study inventati o sconti non autorizzati.

Tabella decisione (compila con i tuoi numeri)

| Workflow | Vincitore in azienda | Seat dedicati | Note dati |

|---|---|---|---|

| Email | ? | ? | DPA / workspace |

| Documenti | ? | ? | niente PII in free |

| Bozza commerciale | ? | ? | no prezzi inventati |

Se due workflow su tre premiano lo stesso tool, parti monocultura e rivaluta tra 60 giorni. Se si spaccano 2-1 su un processo critico (es. contratti), un secondo seat puo costare meno degli errori.

Prezzi e piani: solo cio che serve alla scelta

  • Claude Team (Anthropic, pagina ufficiale): seat standard 20 USD/mese con fatturazione annuale, 25 USD se mensile; esistono seat Premium a uso maggiore. Enterprise e indicato come 20 USD/seat/mese + usage API, con controlli admin avanzati (pricing Anthropic).
  • ChatGPT Business / Enterprise: i piani business sono distinti da Plus individuale; Business tipicamente da almeno 2 utenti. Importi e nomi piano vanno riletti sulla pricing OpenAI al momento dell'acquisto (qui non fissiamo un listino che puo cambiare settimana per settimana).
  • Confronta sempre costo seat x persone che usano davvero + tempo di revisione umana, come in costi reali AI per PMI. Un seat inutilizzato e peggio di un modello "peggiore" usato bene.

Checklist lunedi mattina

1. Scegli un solo workflow pilota (consiglio: email o bozza commerciale).

2. Crea o usa workspace Team/Business; vieta il piano personale per dati clienti.

3. Prepara 5 casi anonimizzati e lo stesso prompt base sui due tool (o sul tool candidato).

4. Compila la tabella tempo / revisioni / inventati / tono.

5. Scrivi la regola in una pagina (chi puo usare cosa), riprendendo la policy interna ChatGPT.

6. Se il tool puo agire (plugin, computer use, connettori), fai l audit permessi prima del roll-out.

7. Rivaluta dopo 10 giorni lavorativi con numeri, non con sensazioni.

Cosa non abbiamo testato (onesta)

  • Verticali regolati (sanita, finance con obblighi specifici) oltre la diligenza generica.
  • Copilot Microsoft come terzo cavallo: se sei gia in Microsoft 365, va in un Test Lab separato.
  • Qualità "assoluta" dei modelli frontier giorno per giorno: qui conta il workflow, non il leaderboard.

Verdetto operativo

Per una PMI italiana il vantaggio non e indovinare il modello vincente su Twitter. E avere un protocollo: stessi compiti, stesse metriche, seat giustificati, dati fuori dai piani personali. Usa questo Test Lab come template; i numeri devono essere i tuoi.

Se ti serve il quadro incentivi e adozione Italia, riparti da Unioncamere e le due velocita e dalla guida pratica AI per PMI.