Dossier
SMF·SPEAK-LANGUAGE
Reçu le
31.07.2026
Instruit le
28.09.2026
Pièces annexées
3
Questions
4

SMF·SPEAK-LANGUAGE

Un prompt peut-il remplacer Speak ?

Apprentissage et langues — AI conversation tutor

Presque Verdict enregistré le 28.09.2026 · Vérifié le 31.07.2026
Prix
17,99 $US/moisSource: apps.apple.com · Vérifié le 31 juillet 2026
Par an
215,88 $US
Temps de fabrication
Un week-end
Votes
0 vote
OuiPresque (coché)Pas encore

Bordereau de suivi des pièces

Pièce A Le prompt
Pièce B Ce que tu perds
Pièce C Pourquoi certains continuent de payer : curriculum and speech feedback
Pièce Q Questions

Verdict

Celle-ci a bougé. La boucle centrale de Speak — tu parles, elle comprend, elle répond dans la langue cible et te corrige — est maintenant assemblée à partir d’un modèle de reconnaissance vocale, d’un modèle de langage et d’une voix, tous des appels API ordinaires. Ça en fait un week-end plutôt qu’une impossibilité, et le verdict quitte le « non » pour cette raison. Ce qui reste derrière, c’est le programme pédagogique : Speak décide ce que tu pratiques et quand, et une fenêtre de chat qui parlera de n’importe quoi est un pire professeur qu’une fenêtre avec un plan.

Pièce B — Ce que tu perds

Pièce A — Le prompt

Reçu le31.07.2026
Construis un partenaire de conversation orale pour une langue que tu apprends, avec les corrections traitées comme la vraie sortie.

La boucle : enregistre depuis le micro, transcris avec un modèle de reconnaissance vocale, envoie la transcription plus un court historique de conversation à un modèle de langage, et prononce la réponse avec une voix de synthèse pour la langue cible. Appuie-pour-parler, pas de détection d’activité vocale — la détection de tour de parole est un gouffre et une clé, c’est une clé.

Le prompt système fait deux travaux et ils doivent rester séparés. Il répond naturellement dans la langue cible à un niveau que tu configures, et il émet un bloc de correction structuré — un tableau JSON de `{original, corrected, kind, note}` — pour tout ce que tu as dit qu’un locuteur natif n’aurait pas dit. Extrais ce bloc de la réponse et stocke-le ; ne le lis jamais à voix haute. Un tuteur qui interrompt chaque phrase pour te corriger arrête la conversation, qui est la seule chose que tu essaies d’avoir.

Donne à chaque session un sujet et un objectif choisis avant qu’elle commence, depuis une liste que tu as écrite — commander à manger, décrire ta semaine, être en désaccord poliment. Affiche l’objectif en haut et fais en sorte que le modèle s’oriente vers lui. Sans ça, le modèle dérive vers du bavardage agréable et inutile en quatre tours.

Ensuite, produis un bilan de session : la transcription, les corrections groupées par type, et ton ratio de temps de parole. Suis les corrections entre sessions et affiche les dix plus fréquentes, ce qui est le rapport qui te rend vraiment meilleur.

Stocke l’audio et les transcriptions localement dans des dossiers datés.

Ne prétends pas noter la prononciation. La confiance de transcription n’est pas un score de prononciation, et la présenter comme telle invente un chiffre.

L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.

Pièce B — Ce que tu perds

  • B.1 un programme pédagogique conçu, pour que chaque session ait un but
  • B.2 un retour de prononciation calibré sur du discours d’apprenant plutôt qu’une reconnaissance générique
  • B.3 l’application mobile, où la pratique orale a vraiment lieu
  • B.4 une latence assez faible pour que la conversation en ait l’air
  • B.5 des leçons et une progression qui fonctionnent sans connexion

Alternatives existantes

Pièce C — Pourquoi certains continuent de payer : curriculum and speech feedback

La pratique orale échoue sur la friction, et une application qui s’ouvre sur une leçon choisie pour toi bat un terminal qui demande de quoi tu veux parler.

Questions

Puis-je récupérer quelque chose de Speak ?

Non — il n’y a aucun export de tes sessions ou de ton historique d’erreurs. Ton journal de correction démarre à la première conversation que tu as avec ton propre projet.

La latence est-elle bonne ?

Avec des appels séparés de transcription, génération et synthèse, attends-toi à quelques secondes entre ton tour et la réponse. Les API voix-à-voix en temps réel réduisent ça à bien moins d’une seconde à un prix plus élevé par minute ; les deux valent la peine d’être essayés, et la plus lente convient pour une langue où tu assembles encore tes phrases.

Combien ça coûte à faire tourner ?

Une conversation d’une demi-heure coûte quelques dizaines de centimes via des appels vocaux et texte séparés, plus via un modèle vocal temps réel. La pratique quotidienne reste bien en dessous de l’abonnement, ce qui est le but.

Quelle est la chose qui ne survit pas à la reconstruction ?

Que quelqu’un décide ce qu’est la leçon du jour. Speak s’ouvre sur un scénario choisi à ton niveau ; ton projet s’ouvre sur un prompt vide, et choisir quoi pratiquer, c’est du travail que tu fais maintenant.

Récépissé

Tu l’as déjà reconstruit toi-même ?