05

컴퓨터 비전(이미지·영상) 시작하기

이미지를 업로드해 모델이 내용을 설명하게 하고, 텍스트 프롬프트로 새로운 이미지·영상을 생성하는 방법까지 실습합니다.

1. Foundry 프로젝트 준비하기

  • 1번 모듈과 같은 방법으로 새 프로젝트를 만들거나 기존 프로젝트를 사용합니다.
Foundry 프로젝트 홈 화면
Foundry 프로젝트 홈 화면

2. 실습 이미지 준비 및 모델 배포

  • 컴퓨터 비전 모델은 AI 시스템이 사진·영상 같은 이미지 기반 데이터를 해석할 수 있게 해줍니다. 이 실습에서는 컴퓨터 비전이 빈티지 컴퓨터 하드웨어를 식별하는 에이전트에 어떻게 활용되는지 살펴봅니다.
  • 새 브라우저 탭에서 images.zip을 내려받아 로컬 폴더에 압축을 풀어 파일들을 확인합니다. 이 파일들이 AI로 분석할 이미지입니다.
  • Foundry 프로젝트가 있는 브라우저 탭으로 돌아와 Discover 페이지의 Models 탭에서 gpt-5-mini 모델을 검색해 기본 설정으로 배포합니다(1분 내외 소요).
  • TIP: 이미 gpt 모델 배포가 있다면 그대로 사용해도 됩니다. 리전 할당량이 부족하면 gpt-5-nano, gpt-5.4-mini 같은 다른 채팅 지원 gpt 모델을 사용하거나 다른 리전에 새 프로젝트를 만들어 보세요.
  • 배포가 끝나면 모델과 대화할 수 있는 모델 플레이그라운드가 열립니다.
모델 플레이그라운드 화면
모델 플레이그라운드 화면

3. 이미지를 업로드해 모델에게 물어보기

  • 왼쪽 내비게이션 패널 하단 버튼으로 패널을 접어 화면을 넓게 사용합니다.
  • 왼쪽 패널의 Instructions를 다음으로 설정합니다: '당신은 사람들이 빈티지 컴퓨터 하드웨어를 식별하도록 돕는 AI 어시스턴트입니다.'
  • 채팅 패널에서 Upload image 버튼으로 로컬에 압축을 푼 이미지 중 하나를 선택합니다. 이미지가 프롬프트 영역에 추가됩니다.
  • '이것에 대해 무엇을 알려줄 수 있어?' 같은 프롬프트 텍스트를 입력하고, 업로드한 이미지와 텍스트가 함께 담긴 프롬프트를 제출합니다.
  • 응답을 검토합니다. 업로드한 이미지에 대한 관련 정보가 담겨 있어야 합니다. 추가한 이미지를 선택하면 다시 볼 수 있습니다.
이미지가 포함된 프롬프트와 응답 화면
이미지가 포함된 프롬프트와 응답 화면

4. 다른 이미지로 반복 실습하기

  • 다른 이미지들도 포함한 프롬프트를 제출해 봅니다. 예: '이게 뭐야?' 또는 '이것에 대해 알려줘.'

5. 텍스트로 새 이미지 생성하기

  • 지금까지는 모델이 시각적 입력을 처리하는 능력을 살펴봤습니다. 이번에는 Computing History 에이전트 웹사이트에 어울리는 이미지를 준비하고 싶다고 가정해, 모델이 어떻게 시각적 출력을 생성하는지 살펴봅니다.
  • TIP: 이 작업에는 이미지 생성 모델에 접근 권한이 있는 구독이 필요합니다.
  • gpt-5-mini 헤더 옆의 '뒤로' 화살표(또는 내비게이션 패널의 Models 페이지)를 사용해 프로젝트의 모델 배포 목록을 확인합니다.
  • '내 프로젝트에서 사용가능'을 선택해 모델 카탈로그를 엽니다.
  • 컬렉션 드롭다운에서 'Azure에서 직접'을, 유추 작업 드롭다운에서 '텍스트에서 이미지로' 를 선택해 이미지 생성용 모델 목록을 확인합니다.
모델 카탈로그의 이미지 생성 모델 목록
모델 카탈로그의 이미지 생성 모델 목록

6. 이미지 생성 모델 배포 및 테스트

  • TIP: 구독에서 사용 가능한 모델은 다를 수 있으며, 모델 배포 가능 여부는 리전별 가용성과 할당량에 따라 달라집니다.
  • gpt-image-2나 FLUX.2-pro 같은 사용 가능한 텍스트-이미지 모델을 선택해 배포합니다(구독·리전에서 사용할 수 없다면 다른 텍스트-이미지 모델을 배포합니다).
  • 모델이 배포되면 이미지 플레이그라운드가 열립니다.
  • 원하는 이미지를 설명하는 프롬프트를 입력합니다. 예: 'CRT 모니터가 달린 빈티지 PC' 그런 다음 생성된 이미지를 검토합니다.
gpt-image-2 이미지 생성 플레이그라운드 테스트 결과
gpt-image-2 이미지 생성 플레이그라운드 테스트 결과

7. 이미지 생성 코드 살펴보기

  • 배포한 모델로 이미지를 생성하는 클라이언트 앱이나 에이전트를 개발하려면 OpenAI API를 사용할 수 있습니다.
  • TIP: 모델 가용성과 플레이그라운드 기능은 상황에 따라 다를 수 있습니다. 일부 이미지 생성 모델은 View code 같은 옵션을 제공하지 않을 수 있는데, 이 경우 플레이그라운드에서 이미지를 생성하거나 코드 샘플이 있는 다른 텍스트-이미지 모델을 사용해 실습을 완료할 수 있습니다.
  • 배포한 모델이 코드 샘플을 제공한다면, Chat 패널에서 View code를 선택합니다. 코드 옵션에서 Language는 Python, SDK는 OpenAI SDK, Authentication은 Key authentication을 선택합니다.
  • 기본 샘플 코드는 OpenAI 클라이언트로 client.images.generate를 호출해 프롬프트로 이미지를 생성한 뒤, 반환된 base64 이미지를 디코딩해 파일로 저장합니다.

8. 영상 생성 체험하기 (사용 가능한 경우)

  • TIP: 이 작업에는 영상 생성 모델에 접근 권한이 있는 구독이 필요합니다.
  • 정적 이미지 외에도 Computing History 에이전트 웹사이트에 영상 콘텐츠를 포함하고 싶을 수 있습니다.
  • 이미지 생성 모델 헤더 옆의 '뒤로' 화살표(또는 내비게이션 패널의 Models 페이지)를 사용해 프로젝트의 모델 배포 목록을 확인합니다.
  • '내 프로젝트에서 사용가능'을 선택해 모델 카탈로그를 엽니다.
  • 컬렉션 드롭다운에서 'Azure에서 직접'을, 유추 작업 드롭다운에서 '비디오 생성'을 선택해 영상 생성용 모델 목록을 확인합니다.
Microsoft Foundry 모델 카탈로그의 영상 생성 모델 목록
Microsoft Foundry 모델 카탈로그의 영상 생성 모델 목록

9. 영상 생성 모델 배포 및 테스트

  • TIP: 구독에서 사용 가능한 모델은 다를 수 있으며, 모델 배포 가능 여부는 리전별 가용성과 할당량에 따라 달라집니다.
  • Sora-2 모델을 선택해 배포합니다(구독에서 사용 가능하다면, 최신 모델 접근을 위해 별도 요청이 필요할 수 있습니다).
  • 모델이 배포되면 영상 플레이그라운드가 열립니다.
  • 원하는 영상을 설명하는 프롬프트를 입력합니다. 예: '이상한 나라의 곰토끼' 그런 다음 생성된 영상을 검토합니다.
sora-2 영상 생성 플레이그라운드 테스트 결과
sora-2 영상 생성 플레이그라운드 테스트 결과

10. 영상 생성 코드 살펴보기

  • 배포한 모델로 영상을 생성하는 클라이언트 앱이나 에이전트를 개발하려면 REST API를 사용할 수 있습니다.
  • Chat 패널에서 View Code를 선택합니다. 기본 샘플 코드는 curl 명령으로 REST 엔드포인트(.../openai/v1/video/generations/jobs)를 호출해 프롬프트·해상도·길이·모델(sora)을 지정한 JSON 본문을 전송합니다.

11. 요약 및 정리

  • 이 실습에서는 Microsoft Foundry에서 비전 지원 모델을 살펴봤습니다 - 시각 데이터를 입력으로 받는 모델, 텍스트 설명을 바탕으로 정적 이미지를 생성하는 모델, 영상을 생성하는 모델까지 다뤘습니다.
  • 정리(Clean up): Microsoft Foundry 사용을 마쳤다면 불필요한 Azure 비용 발생을 막기 위해 만든 리소스를 삭제하세요.
  • Azure 포털(portal.azure.com)에서 만든 리소스가 포함된 리소스 그룹을 선택합니다.
  • Delete resource group을 선택하고 리소스 그룹 이름을 입력해 확인하면 리소스 그룹이 삭제됩니다.
원문 실습 가이드 보기