[verdetto][prompt curato][fonte: ideafast.pro]
Posso vibecodare IdeaFast?
// si costruisce in un weekend, ma restano buchi veri
Un weekend ti porta a temi di dolore ordinati con permalink veri: JSON pubblico di Reddit, classificazione LLM, embedding, clustering. Il verdetto è «quasi» perché il prodotto vive nella decima esecuzione, non nella prima — rate limit, deduplica tra un run e l'altro, bolletta LLM sotto il prezzo dell'abbonamento.
confidenza: media
cos’è: Scandaglia le conversazioni su Reddit, le raggruppa in temi di dolore con un punteggio e citazioni reali, e trasforma i più forti in idee di startup
Indice di costruibilità · gioco editoriale
- Prezzo 19 $/mese peso: più 2
- Tempo più giorni peso: più 1
- Categoria user research non pesa
- Moat scala dell'infrastruttura · qualità di esecuzione peso: meno 3
- Confidenza media peso: zero
- Cosa perdi 5 voci peso: meno 2
- Sito ideafast.pro (si apre in una nuova scheda) non pesa
Il moat pesa più del prezzo: rifarlo è un progetto, non una sera.
Gioco editoriale: il verdetto dice se un agente può, l’indice se conviene.
Cosa costruisci
Scaricare post e commenti da una manciata di subreddit pubblici, classificare le lamentele con un LLM, raggrupparle in temi di dolore con un nome e ordinarli con citazioni cliccabili a fare da prova.
cosa ti serve
- una API key Anthropic o OpenAI
- un modello di embedding
- SQLite
- pazienza con i rate limit di Reddit
Buona voce da «quasi»: la demo è un weekend, il prodotto è l'idraulica di ingestion che ci sta dietro.
Il prompt
Un weekend con un agente di coding. I buchi che restano sono qui sotto, in «cosa perdi».
Build me a Reddit pain finder: a local CLI plus a small dashboard that reads public
Reddit and turns complaints into ranked pain themes with clickable evidence.
- TypeScript on Node 22, SQLite via better-sqlite3, Hono for the dashboard. One
repo, one `npm run scan` entrypoint. No accounts, no cloud, no telemetry.
- Input: subreddits.txt plus a timeframe flag (default 90 days). Fetch posts and
top level comments from Reddit's public JSON endpoints, for example
https://www.reddit.com/r/<sub>/top.json?t=year. One request every 2 seconds, a
real descriptive User-Agent, and cache every raw response in SQLite so re-runs
cost nothing. No OAuth, no logged-in scraping.
- Prefilter to complaint-shaped text with cheap regexes ("I hate", "why is there
no", "wasted hours", "workaround", "gave up on") before spending a single
token. This is the whole cost story, do it first.
- Classify survivors with Claude (ANTHROPIC_API_KEY in .env, batched, cached by
content hash) into: is_pain, severity 1 to 5, one line summary.
- Cluster: embed the summaries, group at cosine similarity above 0.82, then have
Claude name each cluster and pick its 5 strongest verbatim quotes with
permalinks. Never paraphrase a quote, evidence has to be clickable or it is
worthless.
- Score each cluster as frequency x mean severity x recency decay, and persist
scores per run so a later scan can show what moved.
- Dashboard on localhost:3000: ranked clusters, expandable quotes with permalinks,
filter by subreddit, CSV export.
- README: how to choose subreddits, the rate limit rule and why breaking it gets
you blocked, and rough token cost per 1000 comments.
- Out of scope: sources other than Reddit, idea generation, and cross-scan dedupe.
Get one subreddit list producing clusters you actually trust first. Prompt curato: scritto e rivisto a mano per questa app. In inglese di proposito — è la lingua in cui gli agenti di coding rendono meglio.
Cosa perdi
- la scoperta delle community: puoi scandagliare solo i subreddit che ti sono già venuti in mente
- la deduplicazione tra scansioni, quindi le esecuzioni successive ripresentano gli stessi dolori come se fossero nuovi
- un corpus già caldo: ogni nuova scansione paga per intero l'attesa dell'ingestion
- il controllo dei costi: classificare ingenuamente con un LLM un subreddit affollato diventa caro in fretta
- il livello di generazione e validazione delle idee sopra i cluster grezzi
Perché pagano ancora
Il clustering non è la parte difficile: lo è l'infrastruttura noiosa che ci sta intorno. Reddit strozza i client aggressivi, quindi un corpus vero richiede un'ingestion paziente in background, non una scansione che lanci e stai a guardare. Si paga per saltare il riscaldamento e la bolletta delle API, non perché i dati siano segreti. Sono tutti pubblici.
moat: Scala dell'infrastruttura Qualità di esecuzione cos’è un moat
pipeline di ingestion e controllo dei costi, non proprietà dei dati
Chi l’ha già costruito
Partire da qui è vibecoding lo stesso: il prompt serve quando lo vuoi esattamente a modo tuo.
- PRAW (si apre in una nuova scheda) — Python Reddit API wrapper, the usual starting point for the ingestion half (alive)
- BERTopic (si apre in una nuova scheda) — Topic clustering over embeddings, covers the grouping step without an LLM (alive)
Sei d’accordo?
La bilancia dei voti
Ancora nessun voto: il tuo è il primo.
Nessun voto ancora — il primo pesa.