[verdetto][prompt curato][fonte: superscribe.io]
Posso vibecodare Superscribe?
// si costruisce in un weekend, ma restano buchi veri
La metà fatta di dettatura desktop è una build da una sola sessione, con cloni open-source già pronti da forkare. Il prodotto vero è l'altra: trascrivere dal vivo le chiamate sul numero iPhone che già usi vuol dire inoltro dell'operatore, numero Twilio, softphone CallKit e una pipeline media a doppia traccia.
confidenza: alta
cos’è: Trasforma le chiamate sul tuo numero attuale in note pronte per il CRM, con dettatura da desktop e ore fatturabili abbinate in automatico
Indice di costruibilità · gioco editoriale
- Prezzo 38 $/mese peso: più 3
- Tempo una sessione (solo dettatura), più settimane con la cattura delle chiamate peso: meno 2
- Categoria dettatura vocale non pesa
- Moat scala dell'infrastruttura · integrazioni · qualità di esecuzione peso: meno 4
- Confidenza alta peso: più 1
- Cosa perdi 5 voci peso: meno 2
- Sito superscribe.io (si apre in una nuova scheda) non pesa
Il moat pesa più del prezzo: rifarlo è un progetto, non una sera.
Gioco editoriale: il verdetto dice se un agente può, l’indice se conviene.
Cosa costruisci
Assegnare una hotkey globale, mandare in streaming l'audio del microfono a una API STT in tempo reale, far girare una passata di pulizia con un LLM e incollare il risultato nell'app che ha il focus.
cosa ti serve
- i permessi macOS per microfono e accessibilità
- una API key STT in streaming (ElevenLabs Scribe o Deepgram) oppure whisper.cpp in locale
- una API key di un LLM per ripulire la trascrizione
- un account Twilio, un numero e un dispositivo iOS se provi anche la metà sulla cattura delle chiamate
Metà è un «sì» a forma di superwhisper; il binario telefonico sul numero che già hai trascina l'intero prodotto sul «quasi».
Il prompt
Un weekend con un agente di coding. I buchi che restano sono qui sotto, in «cosa perdi».
Build me a push-to-talk dictation tool for macOS to replace Superscribe's desktop app.
Requirements:
- Swift menu bar app, SPM only, no Xcode project. A global hotkey (default: hold
Option+Space) records while held, stops on release.
- Capture the mic with AVAudioEngine, downsample to 16kHz mono PCM, and stream it
over WebSocket to ElevenLabs Scribe realtime (key in .env). Show partial
transcripts in a small floating panel while I speak.
- On release, run one LLM cleanup pass over the final transcript (fix punctuation,
drop filler words; key in the same .env), then paste it into the focused app via
NSPasteboard + CGEvent Cmd-V and restore my previous clipboard afterwards.
- Fallback: with no ElevenLabs key, record to a temp wav and transcribe locally
with whisper.cpp instead. Slower is fine.
- Menu bar icon shows idle/recording/transcribing states; a history window lists
the last 20 transcripts with copy buttons, persisted to ~/Dictation/history.jsonl.
- Ad-hoc codesign for my own machine only. README documents the Microphone and
Accessibility permission prompts and the whisper.cpp model download.
- Out of scope: live word-by-word typing into the field (paste on release only),
Windows support, accounts and billing, and the phone-call capture product. If I
want call notes I will upload recordings by hand. Prompt curato: scritto e rivisto a mano per questa app. In inglese di proposito — è la lingua in cui gli agenti di coding rendono meglio.
Cosa perdi
- la cattura delle chiamate sul numero che già hai (inoltro dell'operatore dentro un softphone CallKit)
- l'inserimento dal vivo, parola per parola, senza glitch e tarato app per app: terminali, editor Electron, contenteditable nei browser
- l'archiviazione automatica: dettature e chiamate finiscono sul progetto giusto grazie agli embedding (arricchiti dal contesto del repo GitHub) e all'attività di commit durante il blocco di lavoro, così le ore fatturabili atterrano sul cliente giusto senza taggare niente
- il workspace intorno alle trascrizioni: ricerca semantica, report PDF pronti per la fattura, bozze di note per il CRM, una API pubblica e un MCP server
- la parità su Windows e installer firmati, notarizzati e capaci di aggiornarsi da soli
Perché pagano ancora
Si paga per il binario del telefono (rispondere normalmente sul numero che si ha già, senza bot e senza un secondo dispositivo) e perché tutto quello che viene dopo arriva già archiviato: trascrizioni abbinate semanticamente al cliente e al progetto giusti usando come contesto la propria attività su GitHub, e poi trasformate in storico ricercabile, fatture e bozze per il CRM.
moat: Scala dell'infrastruttura Integrazioni Qualità di esecuzione cos’è un moat
infrastruttura di telefonia / ampiezza del workspace integrato
Chi l’ha già costruito
Partire da qui è vibecoding lo stesso: il prompt serve quando lo vuoi esattamente a modo tuo.
- Handy (si apre in una nuova scheda) — MIT cross-platform push-to-talk dictation app in Tauri, built to be forked; covers the whole desktop core loop. (alive)
- VoiceInk (si apre in una nuova scheda) — GPL native Swift macOS dictation app with local whisper.cpp and per-app modes; closest open clone of the mac side. (alive)
- FreeFlow (si apre in una nuova scheda) — Solo-built open Wispr Flow clone; working example of cloud STT plus LLM cleanup with active-window context. (alive)
- Twilio Media Streams (si apre in una nuova scheda) — Official docs and tutorials for streaming live call audio to STT; the happy path of the call-capture half. (alive)
Sei d’accordo?
La bilancia dei voti
Ancora nessun voto: il tuo è il primo.
Nessun voto ancora — il primo pesa.