YouTube動画を映像ごとAIに読ませるCLIを作った(Gemini API、Python標準ライブラリのみ)
YouTubeの解説動画をAIに渡して「これを踏まえて実装して」とやりたい。字幕を取れば済むと思っていました。ところが取り出した字幕には、話者が「この図のここが問題で」と言った「ここ」の中身が、1文字も残っていません。 画面にスライドが映り、話者は指すだけ。コードのデモは「こう書き換えます」で済まされる。発話を文字にする道具では、画面の情報は残らない。 この穴を埋めるために、小さなCLIを書きました。 既存の文字起こしOSSが読んでいるもの 同じことを考える人は多いらしい。動画をテキスト化するOSSは、調べた範囲でも大きく2系統ありました。字幕をそのまま取る系(yt-dlp、yout...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →
