[verdetto][prompt curato][fonte: shade.inc]
Posso vibecodare Shade?
// si costruisce in un weekend, ma restano buchi veri
La metà che riguarda la ricerca è reale: keyframe con ffmpeg, embedding con CLIP, audio con whisper, vettori in SQLite, e la clip sui tuoi dischi salta fuori. Quello che non sopravvive al trasloco è ciò che Shade è diventato — streaming in cloud, permessi, approvazioni — cioè una piattaforma, non uno script.
confidenza: media
cos’è: Gestore di asset indicizzati dall'AI per team creativi: cerca il girato per volto, trascrizione, descrizione della scena o una frase intera
Indice di costruibilità · gioco editoriale
- Prezzo 35 $/mese · a persona peso: più 3
- Tempo più giorni peso: più 1
- Categoria audio e video non pesa
- Moat collaborazione · scala dell'infrastruttura · modelli proprietari peso: meno 5
- Confidenza media peso: zero
- Cosa perdi 6 voci peso: meno 3
- Sito shade.inc (si apre in una nuova scheda) non pesa
Il moat pesa più del prezzo: rifarlo è un progetto, non una sera.
Gioco editoriale: il verdetto dice se un agente può, l’indice se conviene.
Cosa costruisci
Scandagliare i miei dischi, estrarre keyframe e trascrizioni, incorporarli entrambi con CLIP e whisper in un indice vettoriale locale, e poi cercare in tutta la libreria in linguaggio naturale.
cosa ti serve
- ffmpeg
- un modello CLIP via transformers.js o Python
- whisper.cpp
- sqlite-vec o un altro vector store locale
- una GPU, oppure pazienza misurata in nottate
La ricerca semantica sul proprio girato è il caso DIY più forte oggi in post-produzione · quello che stai affittando davvero è l'involucro di collaborazione.
Il prompt
Un weekend con un agente di coding. I buchi che restano sono qui sotto, in «cosa perdi».
Build me a semantic search engine for my own footage to replace Shade. Requirements:
- A Python CLI plus a small FastAPI web UI on localhost. SQLite with sqlite-vec for
the vectors and the metadata, one file at ~/FootageIndex/index.db.
- `index <folder>` walks the tree, and for every video ffmpeg pulls a keyframe every
5 seconds plus one at each scene cut detected by the ffmpeg scene filter.
- Each keyframe is embedded with open_clip (ViT-B/32) and stored with its timestamp.
Stills and photos get the same treatment as a single frame.
- Audio goes through whisper.cpp for a transcript with word timestamps, chunked into
30-second windows and embedded with sentence-transformers for text search.
- The search box takes a plain sentence and searches image and transcript vectors
together, returning ranked results as thumbnail, filename, and timecode. Clicking
one opens the clip at that exact frame in a player.
- Indexing is incremental and resumable, keyed on file path plus mtime plus size, and
prints a running count so an overnight run is checkable in the morning.
- Everything runs on my machine, models included · no accounts, no cloud, no
telemetry, no API keys. Files are read only, never moved or renamed.
- Out of scope: face recognition, sharing links, review and comments, and team sync.
Do not build auth or a server deployment, this is a single-user local tool.
- README: installing ffmpeg and whisper.cpp, first-run model downloads, an honest
estimate of indexing hours per TB on CPU versus GPU, and how to reset the index. Prompt curato: scritto e rivisto a mano per questa app. In inglese di proposito — è la lingua in cui gli agenti di coding rendono meglio.
Cosa perdi
- lo streaming in cloud dei file a piena risoluzione senza scaricarli prima
- i link per ospiti con permessi e ruoli per singolo link
- revisione, approvazione e commenti integrati
- il riconoscimento dei volti e il tagging del tipo di inquadratura, che migliorano senza che tu faccia niente
- il sync di team, così che tutti cerchino nello stesso indice
- i plugin per gli NLE e l'integrazione con Slack
Perché pagano ancora
Si paga perché la ricerca conta solo se ce l'ha tutto il team. Un indice locale che vive solo sulla macchina del montatore risolve il problema del montatore e di nessun altro, e chi ha più bisogno di trovare la clip di solito è il più lontano dallo storage. Shade vende l'indice più la consegna di quello che l'indice ha trovato, e la seconda metà è quella cara.
moat: Collaborazione Scala dell'infrastruttura Modelli proprietari cos’è un moat
streaming in cloud, collaborazione e pipeline dei modelli
Alternative gratuite
Non hai voglia di costruirtelo? Queste esistono già, sono gratis o open source, e le abbiamo controllate una per una.
Scartate (1) — e perché
- Immich (si apre in una nuova scheda) — Volti e ricerca visiva per frasi funzionano; le parole pronunciate restano invisibili, ed è uno dei lavori di punta di Shade.
Chi l’ha già costruito
Partire da qui è vibecoding lo stesso: il prompt serve quando lo vuoi esattamente a modo tuo.
- Immich (si apre in una nuova scheda) — Self-hosted photo and video library with CLIP semantic search and face recognition already built in. The closest working proof the search half is solved. (alive)
- PhotoPrism (si apre in una nuova scheda) — Self-hosted AI-tagged media library with local indexing and search. Photo-first, but the same pattern. (alive)
Quanto costa in un anno
35 $/mese 420 $/anno
Listino 35 $ al mese a persona su Shade. L’anno è dodici mesi pieni, senza sconti annuali.
Sei d’accordo?
La bilancia dei voti
Ancora nessun voto: il tuo è il primo.
Nessun voto ancora — il primo pesa.