반응형
블로그 이미지
개발자로서 현장에서 일하면서 새로 접하는 기술들이나 알게된 정보 등을 정리하기 위한 블로그입니다. 운 좋게 미국에서 큰 회사들의 프로젝트에서 컬설턴트로 일하고 있어서 새로운 기술들을 접할 기회가 많이 있습니다. 미국의 IT 프로젝트에서 사용되는 툴들에 대해 많은 분들과 정보를 공유하고 싶습니다.
솔웅

최근에 올라온 글

최근에 달린 댓글

최근에 받은 트랙백

글 보관함

카테고리


반응형

🎬 최종 결과물

클론 목소리로 만든 Live #11 하이라이트 영상 — 한국어·영어 버전 동시 제작했습니다.

🇰🇷 한국어 영상 (15분 46초)

https://youtu.be/2wk0_VQx9I8

 

🇺🇸

 영어 영상 (13분 9초)

https://youtu.be/WwgQDPXcHWs

 

 

지금 이 영상의 나레이션, 제 진짜 목소리가 아닙니다.

알리바바 Qwen3-TTS가 3초짜리 제 음성 샘플 하나로 복제한 AI 버전입니다.

캘린더로는 12일, 실제 집중 작업 시간은 단 18시간이었습니다.

이 글에서는 그 여정 전체 — 기술 선택부터 샘플 튜닝, 영상 파이프라인 연동까지 — 를 정리합니다.


🤖 Qwen3-TTS란?

알리바바 Qwen 팀이 2026년 1월 Apache-2.0으로 공개한 오픈소스 TTS(텍스트 음성 변환) 모델 패밀리입니다.

핵심 기능은 두 가지입니다.

  • Voice Clone (VC): 3초 음성 샘플만으로 실제 목소리 복제
  • Voice Design (VD): "차분한 30대 여성" 같은 자연어 프롬프트로 원하는 음색 설계

10개 언어(한국어 포함)를 지원하고, Apache-2.0이라 상업적으로도 자유롭게 사용 가능합니다.

📌 공식 GitHub: https://github.com/QwenLM/Qwen3-TTS

 

GitHub - QwenLM/Qwen3-TTS: Qwen3-TTS is an open-source series of TTS models developed by the Qwen team at Alibaba Cloud, support

Qwen3-TTS is an open-source series of TTS models developed by the Qwen team at Alibaba Cloud, supporting stable, expressive, and streaming speech generation, free-form voice design, and vivid voice...

github.com

 

💻 로컬 vs API — 저는 API를 선택했습니다

Qwen3-TTS를 실행하는 방법은 두 가지입니다.

방식 장점 단점
로컬 설치 무료, 데이터 외부 전송 없음 GPU 필수 (최소 RTX 3060, 12GB VRAM)
DashScope API PC 사양 무관, 즉시 시작 유료 (약 $0.014/1,000자)

제 PC는 Intel i7-1355U(15W 저전력) + 내장 그래픽으로 GPU가 없습니다.

자연스럽게 **Alibaba Cloud DashScope Intl API(싱가포르 서버)**를 선택했습니다.

📌 DashScope API: https://www.alibabacloud.com/

 

Alibaba Cloud: 클라우드 컴퓨팅 서비스

Alibaba Cloud는 전 세계적으로 확장 가능하고 안전하며 안정적인 클라우드 컴퓨팅 서비스를 제공하는 세계 최고의 클라우드 컴퓨팅 및 인공 지능 기술 회사입니다. 무료 평가판을 제공하고 종량제

www.alibabacloud.com

 

📚 어떻게 배웠나 — VibeLearn AI

이번 학습에는 제가 직접 만든 VibeLearn AI 방법론을 활용했습니다.

Topic을 정하고 → AI와 함께 Roadmap을 만들고 → 매일 실습하며 WorkLog를 남기는 구조입니다.

중요한 건 처음부터 "배워서 무엇을 만들 것인지" 까지 목표로 설정한다는 점입니다.

이번 목표: "Qwen3-TTS를 배워서 Remotion 영상에 클론 목소리를 연동한다"

덕분에 학습이 끝났을 때 Live 11회 영상이 완성되어 있었습니다.

📌 VibeLearn AI (무료): https://github.com/solkit70/VibeLearn-AI

 

GitHub - solkit70/VibeLearn-AI

Contribute to solkit70/VibeLearn-AI development by creating an account on GitHub.

github.com

 

🎤 Voice Clone 과정 — 2단계

API 사용 방법은 생각보다 간단합니다.

Step 1 — 음성 등록 (~4초)

# 샘플 업로드 → voice_id 발급

response = dashscope.MultiModalConversation.call(

    model="qwen3-tts-vc-2026-01-22",

    ref_audio="샘플.mp3",

    ...

)

voice_id = response.output.voice_id

 

Step 2 — 음성 합성 (~10초)

# 텍스트 + voice_id → 클론 목소리

response = dashscope.MultiModalConversation.call(

    model="qwen3-tts-vc-2026-01-22",

    text="합성할 텍스트",

    voice=voice_id,

    stream=False,

)

 

두 단계면 끝입니다. 코드 작업은 VibeCoding(AI 협업 코딩)으로 처리해서 직접 한 줄도 짜지 않았습니다.

⚠️ 주의: 싱가포르 서버(글로벌) 사용자는 Voice Clone(VC)만 가능합니다. Voice Design(VD)은 중국 서버 전용입니다.


🔧 샘플 품질 튜닝 — 3점 → 4점

처음 클론 결과는 5점 만점에 3점이었습니다. 음색은 비슷한데 끊김이 있었습니다.

개선 포인트:

  1. 샘플 녹음 방식 변경: 단어를 끊지 않고 방송 진행하듯 흐르게 읽기 (v1→v4)
  2. ffmpeg 후처리: atempo=1.08 (8% 가속)로 자연스러운 속도 조정

ffmpeg -i input.wav -filter:a "atempo=1.08" output.wav -y

 

결과: 4점 달성. changsoo_final.wav 최종 채택.


💡 실험하면서 발견한 팁들

한국어 콘텐츠엔 한국어 프롬프트

Voice Design 프롬프트를 영어로 입력했더니 일본인이 한국어를 하는 듯한 억양이 나왔습니다. 한국어로 프롬프트를 쓰면 훨씬 자연스럽습니다.

비용 절감 팁

작업 중에는 무료 edge-tts로 영상 타이밍을 먼저 맞추고, 최종본에서만 Qwen3-TTS로 교체하면 비용을 크게 줄일 수 있습니다. 15개 슬라이드 전체 생성 비용은 약 $0.30이었습니다.

이미지 생성 팁

이미지 API를 바로 쓰지 말고, 먼저 AI에게 프롬프트를 만들게 한 다음 ChatGPT·Gemini·Claude에 동시에 넣어 결과를 비교하세요. 제 경험상 ChatGPT와 Gemini가 품질이 가장 좋았습니다.


📁 학습 자료 전체 공개

로드맵, 워크로그 6개, 실습 코드 전부 GitHub에 공개했습니다.

📌 학습 자료: https://github.com/solkit70/CatchUpAI_VL/tree/main/Topics/Qwen3-TTS

 

CatchUpAI_VL/Topics/Qwen3-TTS at main · solkit70/CatchUpAI_VL

Catch Up AI Vibe Learning - AI와 함께하는 체계적인 학습 방법론. Contribute to solkit70/CatchUpAI_VL development by creating an account on GitHub.

github.com

 

VibeLearn AI를 써보고 싶으신 분은 아래에서 무료로 다운받으실 수 있습니다.

배우고 싶은 Topic을 정한 뒤, AI에게 "이걸 배워서 ○○에 활용하고 싶다" 고 말하면 그 목적까지 포함한 Roadmap이 만들어집니다.

📌 VibeLearn AI: https://github.com/solkit70/VibeLearn-AI

 

GitHub - solkit70/VibeLearn-AI

Contribute to solkit70/VibeLearn-AI development by creating an account on GitHub.

github.com

 

🔗 참고 링크 모음


더 궁금하신 점은 댓글로 남겨 주세요.

매주 일요일 밤 9시(한국 시간), 새벽 5시(시애틀)에 라이브 방송도 진행합니다 📺

 

 

반응형


반응형

매주 일요일 새벽 5시 (시애틀 기준), AI를 직접 실험하고 배운 것을 나누는 
AI in Action 라이브 방송을 하고 있습니다. 이번 주는 Live #11, 2026년 5월 24일 
방송의 하이라이트를 영상으로 정리했습니다.

이번 영상에서 다룬 4가지 이야기를 소개합니다.


## 1. 내 목소리를 AI로 복제했다 — Qwen3-TTS Voice Clone

이번 하이라이트 영상의 나레이션은 제 실제 목소리가 아닙니다.
알리바바의 Qwen3-TTS API를 사용해 제 목소리를 복제한 AI 음성입니다.

작동 방식은 두 단계입니다.
- 1단계 (Voice Enrollment): 샘플 음성 파일을 업로드해 고유한 Voice ID 생성
- 2단계 (Synthesis): 그 Voice ID로 원하는 텍스트를 음성으로 변환

라이브 방송 중 처음으로 실시간 API를 호출하는 실험이었습니다.
결과는? Voice Clone(VC)은 5점 만점에 3점. 음색은 반영됐지만 
속도와 자연스러움이 아쉬웠습니다. 이후 작업을 통해 다듬은 버전이 
지금 영상에 들어간 목소리입니다.

컴퓨터 사양이 된다면 로컬에서도 실행 가능하지만, NVIDIA GPU와 
최소 16~32GB VRAM이 필요합니다. 저는 사양이 안 되어 API 방식으로 진행했습니다.


## 2. 비개발자가 Vibe Coding으로 앱을 만들어 수익화하는 시대

시애틀 한인 여성 IT 커뮤니티 W+그룹의 HerStory 행사에 참석했습니다.
세 분의 연사 모두 개발자가 아님에도 직접 앱을 만들어 AI 사업을 하고 계신 분들이었습니다.
시애틀 빅테크에 다니시면서 본인의 도메인 전문성에 AI를 결합해 Vibe Coding으로 
앱을 만들고, 실제 수익화까지 이루신 이야기들이었습니다.

제가 지난 3월 Substack에 썼던 글 — "AI 시대 앱 개발은 어떻게 달라지고 있는가" — 에서
"전문가가 모두를 위해 만드는 시대에서 누구나 자신에게 맞게 만드는 시대로 바뀌고 있다"고 
했는데, 그것이 바로 눈앞에서 펼쳐지고 있었습니다.


## 3. LLM으로 지식 베이스를 자동 구축하는 방법 — LLM Wiki

CMDS x GOBI Cohort 1기 4주차에서는 LLM Wiki에 대한 강의가 있었습니다.
Andrej Karpathy가 제안한 LLM Wiki를 구요한님이 Obsidian에 최적화한 버전입니다.

핵심 구조:
- Raw Source (강의록, 문서 등) → LLM이 읽고 자동 분해
- Wiki 카드 + Entity 카드로 구조화
- 즉시 검색 가능한 지식 베이스 완성

RAG보다 실시간 업데이트가 쉽고, 지식이 즉시 검색 가능한 형태로 
정리된다는 점이 특히 인상적이었습니다.


## 4. "AI랑 하면 뚝딱"은 신화다 — 제작의 현실

이번 주에 모자무싸 영상 제작 과정을 공개했습니다.
글 한 편을 완성하기까지 6단계를 거쳤습니다.

브레인덤프 → 초안 작성 → 버전 비교 분석 → 선별·수정 → 통합 → 다듬기

8명이 넘는 철학자와 사회학자의 개념을 검토했고, 초안을 4번 고쳤습니다.
그 다음에는 Remotion으로 영상 제작, 나레이션·슬라이드·효과 퇴고,
썸네일·제목·Description 작성, SNS 홍보까지.

AI가 없었다면 훨씬 오래 걸렸겠지만, AI만으로는 절대 이 결과물이 나오지 않습니다.
방향을 잡고, 판단하고, 수정하는 — 사람이 주도하는 창작 과정입니다.
"AI랑 하면 뚝딱"은 신화입니다.


## 영상 보기

🇰🇷 한국어 버전: https://youtu.be/ApWkZu0RcWE?si=c_0dVi4hEQFnNJ0O

 

🇺🇸 English version: https://youtu.be/VL-S43gnhe0

 

매주 일요일 밤 9시 (한국) / 새벽 5시 (시애틀), AI in Action 라이브로 
함께하실 분들을 기다립니다. YouTube 채널 구독과 좋아요 부탁드립니다 🙏

 

 

반응형


반응형

요즘 이런 생각을 자주 합니다.

AI가 점점 더 많은 일을 대신하게 되면서, 사람들이 조용히 이런 질문을 품기 시작했습니다.

"나는 쓸모 있는 사람인가?"

거창한 질문처럼 보이지만, 사실 이건 아주 오래된 질문입니다. AI가 등장하기 훨씬 전부터 우리 안에 있었던 불안이죠. AI는 그것을 새로 만들어 낸 게 아니라, 이미 있던 것을 더 선명하게 드러내고 있을 뿐입니다.

이 주제를 오랫동안 생각해 왔고, 결국 글과 영상으로 정리했습니다. 한국어와 영어 버전을 모두 만들었으니, 편하신 언어로 보시거나 주변에 공유해 주세요.


영상으로 보기

바쁜 일상 속에서 글보다 영상이 편하신 분들을 위해 유튜브 영상도 함께 만들었습니다.

 

한국어 영상 — https://youtu.be/DgqbSLjDT-A

 

English Version — https://youtu.be/n8l5Vm_blkE

 


글로 읽기

더 깊이 읽고 싶으신 분들을 위해 Substack에 전문을 올렸습니다.

 

📄 한국어 — https://lifidea.substack.com/p/040?r=57u2e2

 

모두가 자신의 무가치함과 싸우고 있다 - 가치는 누가 정하는가

AI 시대 가치를 정하는 기준을 바꾸어야 하지 않을까? - 우리의 행복을 위해서...

lifidea.substack.com

 

📄 English — https://lifidea.substack.com/p/everyone-is-fighting-their-own-worthlessness?r=57u2e2

 

Everyone Is Fighting Their Own Worthlessness — Who Gets to Decide Your Value?

In the age of AI, shouldn't we change the standard by which value is measured — for our own happiness?

lifidea.substack.com

 

 

 

 

반응형