[verdetto][prompt curato][fonte: scantoexcel.ai]
Posso vibecodare ScanToExcel?
// si costruisce in un weekend, ma restano buchi veri
Un modello di visione legge una tabella stampata e pulita al primo colpo, e quella demo è davvero un pomeriggio di lavoro. La costanza no: celle unite, righe su più linee e colonne che si spostano cambiano esito a ogni esecuzione, ed è per questo che ScanToExcel mette una pipeline di estrazione su misura.
confidenza: media
cos’è: Fotografi una tabella o un modulo e ti torna indietro un vero .xlsx, scrittura a mano compresa
Indice di costruibilità · gioco editoriale
- Prezzo 39,99 $/mese peso: più 3
- Tempo una sessione per tabelle pulite; tempo indefinito per la coerenza peso: più 3
- Categoria documenti e pdf non pesa
- Moat modelli proprietari · qualità di esecuzione peso: meno 3
- Confidenza media peso: zero
- Cosa perdi 5 voci peso: meno 2
- Sito scantoexcel.ai (si apre in una nuova scheda) non pesa
Si pareggiano. È il caso in cui decide quanto ti sta antipatico l’abbonamento.
Gioco editoriale: il verdetto dice se un agente può, l’indice se conviene.
Cosa costruisci
Caricare la foto o la pagina PDF, mandarla a un modello di visione chiedendo la tabella come righe strutturate e scrivere il risultato in un file .xlsx.
cosa ti serve
- una API key OpenAI o Anthropic con supporto vision, nel file .env
- Node.js 22
- una libreria per scrivere fogli di calcolo, come SheetJS o ExcelJS
Il prompt
Un weekend con un agente di coding. I buchi che restano sono qui sotto, in «cosa perdi».
Build a document-to-spreadsheet converter inspired by ScanToExcel.
Use exactly this stack: Next.js 15 + TypeScript.
Primary job: the user uploads a photo or a PDF page containing a table, and gets back a downloadable .xlsx whose cells match the document.
Start from an empty folder and create the complete working project.
Send the image to one vision-capable model and ask for the table as structured rows and columns, not as prose.
Write the result with a spreadsheet library so numbers arrive as numbers and dates as dates, not as text.
Show the extracted table in the browser for review and let the user fix cells before downloading - never hand over a file the user has not seen.
Handle multi-page PDFs by processing pages in order and dropping a repeated header row when the same header appears on a later page.
Single-user and private by default; delete uploads once the download is produced, and say so in the UI.
Put every secret in .env and provide .env.example.
Include clear empty, loading, validation, success and failure states, and show the model's confidence when it reports one.
Accessible keyboard navigation, labels, focus states and sensible contrast.
Deliberately exclude these paid-product advantages: a native mobile capture app, tuned handwriting recognition, batch processing of very long documents.
State plainly in the README that handwriting and low-quality photos are where this build degrades.
Write unit tests for the row-parsing logic and one end-to-end smoke test that converts a sample image to a valid .xlsx.
Create a README with setup, architecture, per-page cost estimate and limitations.
Run the tests and build before finishing, then fix what fails. Prompt curato: scritto e rivisto a mano per questa app. In inglese di proposito — è la lingua in cui gli agenti di coding rendono meglio.
Cosa perdi
- una pipeline di estrazione fatta apposta, invece dell'output grezzo del modello
- lo stesso documento che produce due volte lo stesso foglio di calcolo
- la struttura tenuta insieme su più pagine: celle unite, righe su più linee, colonne che si spostano
- un riconoscimento affidabile della scrittura a mano
- un'app per telefono che fotografa e converte senza passare dal computer
Perché pagano ancora
Perché la demo funziona e il centesimo documento no. I commercialisti gli danno in pasto foto storte, scattate col telefono, di moduli a ricalco con intestazioni unite, ed è su quella pagina che si vede la differenza tra uno strumento e uno script. Pagare per un output di cui fidarsi senza controllare cella per cella è uno scambio facile, per chi fattura a ore.
moat: Modelli proprietari Qualità di esecuzione cos’è un moat
pipeline di estrazione su misura, gestione riproducibile della struttura
Chi l’ha già costruito
Partire da qui è vibecoding lo stesso: il prompt serve quando lo vuoi esattamente a modo tuo.
- img2table (si apre in una nuova scheda) — Table identification and extraction from images and PDFs, no model API required.
- Camelot (si apre in una nuova scheda) — Extracts tables from text-based PDFs into DataFrames.
- docling (si apre in una nuova scheda) — Document parsing to structured formats, including table structure recovery.
Sei d’accordo?
La bilancia dei voti
Ancora nessun voto: il tuo è il primo.
Nessun voto ancora — il primo pesa.