AI3Discovery English
플랫폼 신약 탐색 단백질 설계 바이오마커 신소재 연구 협력 회사 소개 함께 하기 English

논문에서 출발해, 공개 데이터에서 ART 좌위를 다시 찾다

공개된 방법으로 탐색 환경을 독립 구축하고, 도식과의 사후 대조와 읽기 기반 복원으로 ART 좌위를 확인한 기록.

ART(array-associated reverse transcriptase)는 역전사효소 유전자, 이웃한 파트너 유전자, 반복 배열이 함께 나타나는 시스템이다. Anthropic 연구진은 자율 AI 에이전트를 이용해 이 연관성을 찾아냈고 Autonomous AI agents discover reverse transcriptases with tandem repeat arrays라는 논문으로 보고했다.

우리는 논문을 읽고 질문을 하나 세웠다. 공개된 단서만으로 같은 계열의 좌위를 실제 데이터에서 찾아갈 수 있을까? 알려진 좌위에 검색 도구를 맞추는 것과 넓은 데이터에서 후보를 찾아 이웃 유전자와 비암호화 영역까지 확인하는 것은 다른 작업이다.

이번 글은 그 탐색의 기록이다. 최초 발견의 공로는 원 연구진에게 있다. AI3 Discovery가 확인한 것은 공개된 방법의 독립 구현, 알려진 사례의 재현, 그리고 상류 서열을 복원하면 드러나는 추가 배열이다.

좌위 목록을 입력하지 않고, 계열의 단서에서 출발했다

출발점은 논문이 공개한 RT 씨앗 서열과 Methods였다. 씨앗을 정렬해 계열 프로파일을 만들고 공개 단백질 카탈로그에서 후보를 수집했다. 알려진 다른 RT 계열과 비교한 뒤, 후보가 들어 있는 컨티그로 돌아가 유전자와 반복 배열의 배치를 확인했다.

논문을 참고했으므로 방법이나 씨앗에서 독립된 발견 실험은 아니다. 독립적인 부분은 분석 환경과 검색 실행이다. 논문 대표 좌위의 접근번호를 정답으로 넣어 해당 위치를 불러오지 않았고 검색으로 도달한 서열을 보존한 뒤 논문의 인쇄 서열·도식과 대조했다. 원 연구의 전체 실행 환경을 그대로 복제했다고 주장하지도 않는다.

  • 문헌의 정의 구현 공개 씨앗으로 RT 계열을 찾을 수 있는 환경을 구축했다.
  • 공개 데이터 탐색 단백질 후보를 수집하고 다른 RT 계열과 구분했다.
  • 좌위 맥락 확인 컨티그에서 RT·파트너·상류 배열을 함께 평가했다.
  • 논문과 사후 대조 보존한 결과를 인쇄 서열·도식의 지문과 비교했다.

후보가 ART 계열에 연결된다는 사실만으로는 배열을 가진 좌위라고 할 수 없다. 그래서 RT의 계열성, 파트너 유전자, 상류 반복 배열을 나누어 확인했다. 데이터가 짧거나 손상돼 배열을 볼 수 없으면 미평가로 남겼다.

처음 찾은 좌위가 논문의 대표 사례로 돌아왔다

중요한 첫 결과는 GEM(Genomes from Earth's Microbiome) 카탈로그의 메타게놈 조립체에서 나왔다. RT와 바로 이웃한 파트너 유전자가 있었고 상류에는 14개 반복 사본이 일정한 간격으로 놓여 있었다. 단백질 후보에서 DNA 맥락까지 돌아가 배열을 확인한 결과였다.

이후 논문에 인쇄된 반복과 양쪽 주변 서열을 대조했다. 반복이 놓인 순서도, 주변 서열도 함께 대응했다. 유전자 길이와 배열 간격까지 비교해 보니 이 GEM 결과는 논문의 대표 사례 L0050 또는 매우 가까운 변이형에 해당했다. 서로 다른 조립체일 가능성이 있어서 원 논문의 서열과 염기 단위로 완전히 같은 조립이라고 단정하지는 않는다.

Logan 데이터에서 찾은 ERR8055547_17666_12와 SRR8925777_19762_9도 이어서 대조했다. 각각 보충 도식의 ART_34와 ART_69에 대응했다. 초기 직접 탐색 결과 가운데 3건이 이렇게 알려진 사례의 재현으로 정리됐다.

당시에는 후보로 보였지만 대조한 뒤 신규 후보 목록에서 빼고 재현 자료로 분류했다. 이 순서가 중요하다. 도식과 일치한다는 것은 검색이 계열의 실제 좌위에 도달했다는 증거지만 신규 발견의 근거는 되지 못한다.

ART 분석 그래프 architecture

유전자 배치의 사후 대조. 논문 도식에서 추출한 반복 위치와 유전자 길이를 같은 척도로 다시 그렸다. ART_34·ART_69는 종결코돈 길이 규약을 통일한 뒤 RT·파트너 CDS 길이와 유전자 사이 간격이 맞았다. L0050은 서열과 배열 구조가 대응하는 사례다. 그림에서 가까워 보인다는 이유만으로 같은 원 조립체라고 주장하지 않는다.

염기서열과 간격열을 함께 보았다

단백질 길이만 같은 후보는 우연히 나올 수 있다. 반복 배열은 여러 간격이 순서대로 이어지므로 더 많은 정보를 준다. ART_34에서는 3개, ART_69에서는 3개의 연속 간격이 도식에서 읽은 값과 일치했다. 우리 검출기가 추가로 호출한 반복도 숨기지 않고 전체 간격열에 남겼다.

L0050에서도 관측한 간격열과 도식에서 환산한 간격열이 가까웠다. 최대 차이는 4 nt였다. 이 값은 도식의 위치를 좌표로 환산한 결과라서 원시 서열을 직접 비교한 결과만큼 정밀하다고 읽어서는 안 된다.

ART 분석 그래프 fingerprint

반복 시작→시작 간격의 지문. 채운 점은 우리 관측, 테두리는 논문 도식이다. 겹치는 지점이 연속 대응 부분이다. 모든 반복이 똑같이 호출되지는 않았다. 연속 부분 배열의 일치와 전체 배열의 동일성은 구분했다. 각 도식 사례를 서로 다른 계열의 공통 반복 서열에 억지로 맞추지 않았다.

짧은 컨티그 때문에 상류 배열을 확인할 수 없었다

탐색을 계속하자 RT와 파트너는 찾았지만 배열은 판정할 수 없는 후보들이 쌓였다. 그렇다고 배열이 없다고 결론 내릴 수는 없었다. RT의 상류 서열이 컨티그 끝에서 잘려 나가 배열이 들어 있을 공간 자체를 보지 못했기 때문이다.

그래서 후보가 나온 시료의 원래 읽기(reads)로 돌아갔다. 후보 컨티그에 연결되는 읽기로 상류를 연장하고 새로 조립한 구성원 서열에서 배열을 다시 평가했다. 그다음 읽기를 복원 서열에 되매핑해 지지 깊이도 확인했다.

예를 들어 ERR10896470_6887_1은 처음에 상류를 232 nt밖에 확보하지 못했다. 읽기 기반 복원 뒤에는 3,597 nt를 확보했고 반복 배열이 드러났다. ERR4236129_15347_m도 301 nt에서 3,585 nt로 늘어나 배열을 평가할 수 있게 됐다.

복원 결과 가운데 일부는 논문 도식과 다시 대응했다. ART_38은 유전자 길이와 연속 간격열이 맞았고 SA1은 근접 대응이었다. ART_95는 간격열은 대응했지만 파트너 길이 불일치가 남아 시사적 대응으로 두었다. 정확 대응·근접 대응·시사적 대응을 같은 확정 등급으로 합치지 않았다.

ART 분석 그래프 recovery

복원 전후 RT 상류의 확보 길이. 그래프의 변화는 실제 복원 산출물의 길이로 계산했다. 과거 숫자를 새 분석에서 손으로 보정한 결과가 아니다. 복원된 서열은 해당 군집 구성원의 서열이다. 군집 대표의 원 좌위를 그대로 재구성했다는 뜻은 아니다.

같은 배열 구조가 서로 다른 시료에서 다시 나타났다

읽기 기반 복원은 도식과 대응하는 좌위를 더 찾는 데서 끝나지 않았다. ERR10896470 계열에서는 도식 지문과 일치하지 않는 반복 배열을 확인했다. RT와 파트너의 맥락, 반복 사본, 스페이서 배치, 되매핑 지지를 함께 검토한 결과다.

초기 종결 집계에서는 이 계열의 4개 관측을 강한 증거로 분류했다. 이들은 3개 BioProject에서 나왔다. 같은 BioProject에 속하는 두 시료를 독립 연구 두 건으로 세지 않았다. 다른 시료에서 비슷한 간격열이 다시 보였으니, 한 조립 산출물에서만 생긴 우연한 배열보다 재현 근거가 강하다.

'도식에 보이지 않는다'는 표현의 범위는 분명히 해 둔다. 우리가 비교할 수 있었던 인쇄 서열과 도식 지문에 대응하지 않았다는 데까지다. 논문 전체의 모든 계열과 모든 구성원에서 보고되지 않았다는 뜻은 아니다. 그래서 이 결과를 도식 밖에서 확인한 ART 계열 연결·파트너·배열 구조로 소개한다. 생물학적 기능과 세계 최초의 신규성은 별도 검증이 필요하다.

ART 분석 그래프 replication

도식 밖 계열의 시료 간 간격열. 관측 시료의 이름과 BioProject를 함께 적었다. 작은 막대는 공통 척도로 그린 반복 시작→시작 간격이다. 비슷한 간격열이 재현됐지만 시료 사이의 작은 차이도 그대로 남겼다. 같은 연구의 반복 관측은 증거의 양과 독립 단위 수에서 따로 센다.

강한 배열과 미평가 후보는 같은 발견 수가 아니다

읽기 추적의 초기 종결 스냅샷에는 고유 후보 id 52개가 담겼다. 이 가운데 강한 증거로 분류된 것은 7개였다. 여기에는 알려진 논문 사례와 대응하는 복원 결과도 들어 있으니 이 수를 신규 좌위 수로 읽으면 안 된다. 중간·약한 증거와 배열없음, 미평가, 판정불가도 따로 보존했다.

컨티그가 짧거나 읽기가 불완전하면 음성으로 세지 않는다. 배열이 검출되지 않은 결과도 해당 복원 서열에 한정한다. 데이터의 빈 공간을 생물학적 부재로 바꾸지 않기 위해서다.

ART 분석 그래프 classification

초기 종결 스냅샷의 증거 수준. 분모는 군집도 BioProject도 아닌 고유 후보 id다. 후속 시험과 다른 시점의 누적 결과는 합치지 않았다. 분류별 값과 단위는 아래 데이터 표에서 확인할 수 있다.

증거 수준고유 후보 id
강7
중간1
약4
배열없음(이 복원 서열)11
미평가17
판정불가(부분)4
판정불가(상류 짧음)4
판정불가2
단일말단2

확인 층의 문제를 더 직접 보려고 ART 계열에 연결되지만 상류 맥락을 충분히 보지 못했던 후보를 별도 시험에서 읽기 추적했다. 판정 가능한 8개 BioProject의 15개 복원 컨티그에서 모두 배열 호출이 나왔다.

이 표본에서는 짧은 컨티그가 배열 확인을 가리고 있었다는 해석을 지지하는 결과다. 다만 배열 호출에는 경계 수준의 결과도 섞여 있다. 큰 읽기 데이터 가운데 시험하지 않은 시료가 있고 복원 실패와 상류 부족 사례도 남았다. 그래서 전체 후보의 양성률이나 강한 신규 좌위 수로 환산하지 않는다.

ART 분석 그래프 hidden

상류 복원 뒤 판정 가능한 컨티그에서 나온 배열 호출. 점 하나는 컨티그 하나다. 여러 점이 같은 BioProject에 묶여 있을 수 있으므로 점 수가 곧 독립 연구 수는 아니다. 실패·미평가 사례는 이 분모에 들어 있지 않고, 모든 점이 강한 배열 등급인 것도 아니다.

이번 재현이 입증하지 않은 것

논문 도식의 일부는 찾지 못했다. 도면 역산 시험에서는 평가 대상으로 잡힌 범위에서 정확·근접 회수가 6/26이었다. 이 시험은 최초 탐색 뒤 도식을 알고 수행한 감도 진단이다. 블라인드 탐색 결과가 아니다.

모든 ART 계열을 완전히 회수한 도구라고 주장할 수 없다. 추가 구조의 기능, 발현, 역전사 산물, 파지 감염 때의 역할은 이 계산 결과만으로 확정되지 않는다. 원 연구진이 수행한 실험적 검증과 이번 독립 계산의 결과는 구분해서 읽어야 한다.

좌위 하나를 넘어, 다시 찾아갈 수 있는 경로

이 프로젝트에서 가장 설득력 있는 순간은 처음의 높은 검색 점수가 아니었다. 공개 데이터에서 먼저 도달한 좌위가 나중에 논문의 인쇄 서열, 유전자 배치, 연속 간격열과 대응한 순간이었다. 그 대응을 확인한 뒤 신규 후보라는 설명을 버리고 재현으로 분류했다.

그다음에는 데이터가 잘린 지점으로 돌아갔다. 상류 컨티그를 읽기로 복원하자 배열을 판정할 수 있게 됐고 서로 다른 연구 시료에서 도식 밖 계열의 구조가 다시 나타났다.

AI3 Discovery는 이런 탐색 경로를 구축하고 있다. 후보 서열을 찾으면 원자료로 돌아가 같은 구조가 다시 보이는지 확인하고 알려진 사례와 추가 증거를 분리한다.

그 경로를 신뢰하려면 일치한 결과만큼 미평가와 실패도 남겨야 한다. 이번 ART 재현은 그 원칙을 실제 공개 서열에 적용한 사례다.

이어지는 구조 연구

좌위 재현과 별도로, 공개 상동 서열로 ART 파트너의 정렬을 보강하고 행을 섞은 대조군과 비교해 예측 신뢰도 상승을 확인했다. 이어서 서로 다른 방법이 예측 구조를 어떻게 읽는지 비교했다. 연구 소개와 영문·한글 PDF, Zenodo 검산용 데이터를 공개했다. 자체 공개한 연구 원고이며 사람의 독립적인 동료 심사를 거치지 않았다. 예측 신뢰도 상승을 도메인 개수나 효소 활성의 확정으로 해석하지는 않는다.

출처와 데이터의 범위

이 글의 그래프는 보존된 서열 분석 산출물과 종결 표에서 프로그램으로 생성했다. 논문 도식은 재현된 좌위를 사후 대조하는 자료로 사용했다. 엄격한 도식 비열람을 증명하는 블라인드 접근 감사는 수행하지 않았다. 새로운 생물학적 기능이나 세계 최초 발견을 주장하는 글이 아니다.

연구 하네스와 AI 활용. 이번 연구에는 AI3 Discovery의 과학 연구 하네스를 사용했다. 이 하네스는 AI 코딩·분석 에이전트와 함께 서열 탐색, 계산 분석, 근거 확인, 원고 작성을 하나의 추적 가능한 작업 흐름으로 연결한다. 각 결과는 원자료와 대조했다. 자동 점검과 AI 검토가 사람의 독립적인 동료 심사를 대신하지는 않으며, 공개한 내용에 대한 책임은 AI3 Discovery에 있다.

AI의 잠재력을 과학 연구로 함께 연결할 연구자·연구실을 찾습니다
AI는 과학 연구의 가능성을 크게 넓힐 잠재력이 있습니다. AI3 Discovery와 함께 그 잠재력을 실제 연구에 활용할 연구자와 연구실의 연락을 기다립니다. 탐구하고 싶은 과학적 질문, 분석이 필요한 데이터, 계산과 연결하고 싶은 실험이 있다면 함께 이야기해 보세요. 공동연구 문의: [email protected]

찾을 수 없던 것을 함께 찾습니다.